在AI硬件集体抢跑眼镜赛道的时候,一家公司选择把顺序反过来。10月6日前后,语音AI公司Sesame发布了一轮重要更新:旗下Maya、Miles、Charlie、Simone四位语音智能体从预览转为正式可用,登陆苹果与安卓双端,每位智能体都配有一台自己的电脑,可以自主使用工具、协调其他智能体并接入日常服务,还能挂载用户自有的MCP连接器。公司同时确认,真正的主角AI眼镜要到2027年才登场,镜框由日本匠人手工打磨。先建语音操作系统,再上硬件载体,这条路线在一片抢发硬件的行业里显得相当另类。
这次更新最硬核的变化,是每位语音智能体背后都有独立的计算环境。用户可以在散步、通勤时用语音给智能体布置任务,比如规划一次旅行、调研一个项目,然后该干嘛干嘛,等智能体把活干完再来汇报。这不再是会聊天的语音助手,而是能异步执行多步任务的数字员工。官方演示里,四位智能体甚至可以通过语音调度Devin、Claude Code与Codex这些编程智能体,边走边指挥代码干活。
值得注意的是延迟与功耗的平衡,独立计算环境意味着任务在云端执行而非耳机里实时完成,这对网络依赖提出了要求,也解释了为什么公司选择先把异步任务场景打磨扎实,再考虑全天候佩戴的实时交互。
生态接入同样铺开:智能体可以直接使用谷歌系应用,用户也能挂载自己的MCP连接器,把私有工具链接进来。独立电脑、工具调用、多智能体协调、MCP扩展,这套组合拳把语音入口升级成了任务入口。行业普遍把语音交互当作硬件的附属功能,Sesame把它倒转过来,语音是操作系统,硬件只是它未来的宿主。这个判断如果成立,先发的智能体能力就会成为硬件发布时最难复制的护城河。
硬件之外,这次的语音底座也换代了。更新的对话语音模型带来更有表现力的语音与更清晰的发音,长对话中的表现尤其得到改善。Sesame在角色塑造上做了两件反直觉的事:刻意降低讨好倾向,减少重复句式,让智能体能够反驳用户而不是无条件附和。在各大厂商都想让AI更贴心的时候,这家公司在教AI如何不迎合。
角色团队的工作方式也别具一格。编剧、制作人、演员与研究者一起写剧本、建角色档案、设计场景,把声音与人格当作一个整体系统来打磨。Maya与Miles作为早期主打的两位角色,性格辨识度被进一步强化。这套做法来自影视行业而非工程团队,却恰好命中了语音伴侣产品的命门:用户长期使用一个语音产品,留住的从来不是准确率,而是关系感。技术指标决定下限,人格设计决定上限。
这套方法论已经开始显现差异化结果,试听对比里角色会记住此前的对话脉络、主动延续上一次的话题,而不是每次都从零开始寒暄。长期记忆的质感,正在成为语音伴侣产品口碑分野的关键变量。
硬件路线图上,Sesame给出的答案是等。眼镜计划2027年推出,官方物料里的描述是人们愿意天天戴的镜框:由拥有数十年经验的日本匠人参与制作,在重量、铰链、贴合度、材质与抛光上花功夫,每副镜框经过数天的手工塑形与装配。这个叙事把AI眼镜从电子产品重新定义成了穿戴工艺品,瞄准的是眼镜行业真正的痛点,绝大多数智能眼镜输在不肯好好做一副眼镜。
先软件后硬件的节奏也降低了赌错的风险。硬件行业的教训是,在交互范式成熟前抢发设备,往往既卖不动又透支品牌。Sesame用两年时间在手机端验证语音智能体的日常使用场景,等眼镜上市时,购买理由不再是尝鲜一台新设备,而是给已经离不开的智能体找一个全天候的载体。公司尚未公布定价与具体配置,但这个先建关系再卖硬件的打法,已经与其他厂商拉开了身位。
供应链层面同样透着耐心,公司没有急于公布代工伙伴与产能规划,而是把镜框工艺当作与语音模型同等重要的研发对象。对一款要贴脸戴一整天的设备,佩戴体验的优先级压过参数堆料,本身就是一次定位宣言。
从行业节奏看,2027年恰好卡在多家厂商硬件换代的节点之后,届时语音智能体的日常渗透率会比今天高出一个台阶,Sesame的等待可能正好赶上用户习惯成熟的窗口,晚发反而占到了天时。
Sesame的路线给AI硬件行业提供了几个可对照的坐标。第一,入口即生态:语音智能体如果真的成为用户的日常任务入口,硬件只是它众多宿主中的一个,做硬件的厂商反而需要思考自己的设备上跑着谁的智能体。第二,人格即留存:当功能差异被追平,角色的一致性与性格深度会成为用户迁移成本的核心,这是内容行业的打法,也是硬件行业最陌生的能力。
第三,节奏即战略:在一个所有人都怕错过的赛道里,敢把硬件推迟到能力成熟之后,需要的不仅是对产品的信心,更是对资金与团队的纪律性。AI眼镜被预测为下一个十亿台设备,但预测兑现的前提是出现真正愿意天天佩戴的理由。2027年当Sesame的眼镜上市时,市场检验的将不只是产品,还有慢一步是不是好一步这个行业问题。在那之前,先上场的语音智能体,得先把日子过好。