腾讯混元发布Gander:小脑管对话大脑管推理,打断率压到8%

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

对着语音助手说话时,你大概率经历过这样的停顿:一句话说完,对方沉默两三秒才开始回应;你中途想补充一句,它却还在自说自话。这种轮流发言的节奏来自模型架构本身,生成语音的模块和做推理的模块挤在同一条链路上,复杂任务一多,对话就被卡住。9月,腾讯混元语音团队联合浙江大学、上海交通大学、香港中文大学与南洋理工大学推出全双工交互模型Gander,试图从结构上拆掉这个瓶颈。

语音助手的老问题:只会轮流说话

现有语音助手大多采用严格轮流交互的模式,无法适配真实对话中双方随时打断、边听边说的场景。问题出在计算资源的竞争上:当模型同时在处理一段长思维链推理和输出语音时,音频令牌的生成会被拖慢,用户感受到的就是卡顿与延迟。

行业调研里,延迟一直是实时语音系统开发团队反映最集中的技术痛点。后台工具调用或联网检索耗时几秒,自然对话的错觉就彻底破碎。Gander的思路不是把单个模型训练得更快,而是承认两件事本身要求不同:闲聊对话追求即时响应与持续适应上下文,复杂工作流需要长程推理、迭代规划与工具调用,硬塞进同一个模型必然互相拖累。

更麻烦的是,这类系统通常由语音识别、语言模型、语音合成三段管线串联而成,每一段都会引入一次延迟与误差,级联之后用户听到的回应既慢又容易失真。在全双工场景里,管线式设计还有一个硬伤:用户与系统同时发声时前端只有一条通道,要么把用户的话截断,要么把系统已经生成的输出丢掉。

小脑与大脑:把实时对话和复杂推理拆开

Gander采用小脑与大脑协作的双模块设计,命名参照人体结构。小脑负责秒级的交互流程,判断此刻该倾听、该发言,还是在用户插话时立刻停止输出;它以连续音频、文本与视频为输入,把对话切成离散片段逐段决策,依托近两分钟的滚动上下文作为记忆。

一个容易被忽略的细节是,Gander不需要独立的语音活动检测模块。传统管线要先判断用户是否说完,再交给语言模型处理,这个判断环节本身就是延迟来源;把边界预测内化进模型,等于砍掉了整段等待。

大脑则在后台承担多步推理、文件检索、代码生成等智能体任务,与对话模块通过工具调用和编排运行时持续通信。两个模块的拆分让重计算不再冻结语音输出,也就保住了对话的连续性。

两个模块之间并非简单的先后调用。小脑在用户说话的过程中就已经开始决策,包括是否要提前唤醒大脑做准备、是否要抑制自己正在输出的内容;大脑返回结果之后,小脑再决定用什么节奏和语气把结论说出来。这种持续通信让反应看起来像是听懂了,而不只是接上了话。

100个场景全对,打断率8%,但任务准确率垫底

在Full-Duplex-Bench v3的100个测试场景中,Gander全部在恰当的时间点开口,时机准确率100%。打断用户的比例只有8%,GPT-Realtime为13.5%,Gemini Live 3.1为19.2%,表现最弱的参评系统接近48%。

但同一张表里也有难看的数据。Gander的工具选择F1为0.759,在七个系统中最低,GPT-Realtime是0.876;回应质量0.490,对手为0.792。更值得注意的是,超过一半的恰当发言以填充语开场,比例51.6%,而GPT-Realtime只有16.9%。

技术报告给出了部分解释:现有评测对整套系统统一打分,语音识别与输出环节的误差也会拉低最终得分;如果绕过小脑与音频链路,直接给大脑输入文本,工具选择F1会升到0.934。音视频理解能力也弱于其基础模型,多模态指标WorldSense从55.70%降到49.62%,Daily-Omni从80.20%降到78.53%。

可替换的大脑,意味着底层模型升级就能带动整体

Gander架构里最值得记一笔的设计,是大脑模块可以整体替换。它可以直接换成Codex、Claude Code等不同智能体系统,无需重新训练对话模块;测试中这个位置曾接入OpenAI GPT-5.6系列的某款模型,底层模型升级即可带动整套系统能力提升。

这个设计把语音交互层和推理能力层解耦,带来两个实际好处。其一,模型迭代的收益可以直接传导,不必每换一次基座就重训一遍对话能力。其二,企业可以按场景选配:对响应速度敏感的客服场景用轻量大脑,对准确性敏感的研发场景换更贵的推理模型,小脑部分保持一致。

训练侧的数据组织也反映了这个取向。Gander共使用约270万个样本完成训练,其中约41%是视频,部分样本专门用于教会模型在存在背景噪音、或对话场景中无人面向模型发言时保持安静。让小脑学会闭嘴,和让它学会开口同样重要。

全双工为什么是语音交互的分水岭

全双工的意义不在于把延迟从三秒压到一秒,而在于改变交互的默认假设。轮流发言的系统里,用户需要配合机器的节奏,把想说的话整理成完整句子再开口;全双工系统允许边想边说、中途改口、被打断后继续,交互成本随之下降。

这条路线近半年在头部团队里明显加速。OpenAI的GPT-Live把实时对话与后台推理分开,把联网检索等重任务交给次级模型;英伟达开源的VoiceChat 11B走的是开源全双工路线;Nuance Labs则把语音识别、语言模型、语音合成与面部动画四段管线合并成单模型。共同点是都在解决同一个矛盾:对话要快,推理要深。

Gander的贡献在于把分工做得更明确,并用可替换大脑的方式给系统留出升级通道。它目前的短板也很清楚,任务准确率与感知能力都落后于对话时机表现。代码已在GitHub上线并提供演示页面,研究团队表示待开源流程完成后将公开模型权重与训练数据。权重开放之后,这套小脑加大脑的拆分能否被复用到车载、客服、硬件助手等场景,才是真正的检验。

素材来源:央广网、网易科技、机器之心、The Decoder 发布时间:2026-09-22