英伟达开源全双工语音大模型,边听边说随时打断,叫板闭源实时语音方案

首页 / AI资讯 / AI大厂

0:00
0:00
1x
定时

8月3日,英伟达在Hugging Face上发布了一款名为Nemotron VoiceChat的语音模型,并毫不客气地给自己贴上了首个开放的全双工语音模型的标签。这个11B参数的模型,能在一套网络中同时完成流式语音理解和语音生成,支持随时插嘴打断,还能在对话过程中实时调用工具,矛头直指OpenAI Realtime API等闭源实时语音方案。

全双工三个字,是理解这款模型价值的关键。传统的语音助手遵循说、等、回应回合制节奏,用户要等模型把话说完才能开口,中间还要经历唤醒词检测的延迟。Nemotron VoiceChat把听和说压缩进同一个神经处理过程,用户可以在对话中途直接打断,模型会实时调整输出,这种结构性改变正在重新定义人机语音交互的体验基线,也标志着开源语音模型首次在实时交互这一维度上向闭源方案发起正面挑战。

全双工如何终结说完再等的回合制

大多数语音助手的本质是三个程序的接力赛:自动语音识别把语音转成文字,大语言模型根据文字生成回复,语音合成再把回复读出来,每一步交接都在消耗时间,而且整个链路必须等待一个回合检测器宣布用户已经说完。Nemotron VoiceChat把这个级联流程压缩成了单一网络,彻底消除了回合制的等待,用户不再需要唤醒词,开口就能对话。

具体实现上,音频先经过一个Fast Conformer语音编码器,转换成音频token后送入Nemotron Nano v2 9B骨干网络进行推理,再由TTS解码器输出22.05kHz的语音,同时一个独立的输出通道负责生成工具调用脚本,工具调用不会污染语音输出。实测数据方面,模型在Full-Duplex-Bench 1.0上的交接延迟约448毫秒,用户打断后让位约480毫秒,GPT-4o对打断处理质量的评分为4.33分,这些数字已经接近商业闭源方案的水平。

边说话边调工具的工程巧思

工具调用是Nemotron VoiceChat最引人注目的差异化能力。语音模型不仅能说,还能动手操作,这填补了企业自动化场景中此前一直缺失的关键拼图。模型为每个工具定义了on-hold话术,当它决定发起工具调用时,会先说出这句填充性话语,让API响应的等待期不至于冷场,对话得以保持自然流畅,相当于语音Agent版本的让我查一下。

从基准测试看,模型在AU Harness BFCL-v3上的平均得分为56.1%,在Full-Duplex-Bench v3上选择正确工具的比例达82.5%,但参数填充正确率只有44.2%,选出工具和正确填参之间仍有差距。英伟达也坦诚地给出了使用建议:每场会话最多五个工具,不支持可靠的多工具并行调用,工具执行期间用户无法打断,这些局限说明全双工和可打断的工具调用还不是同一件事,也留给了社区继续改进的空间。

55万小时音频与开源协议

训练数据方面,英伟达披露模型基于约55万小时的音频训练,混合了合成TTS输出、Fisher、LibriVox、LibriTTS、HiFi-TTS、VCTK等公开语料以及内部录音室数据。模型权重采用OpenMDW 1.1协议,配套的NeMo代码则以Apache 2.0开源,部署门槛是至少80GB显存的英伟达GPU,对个人开发者来说更多是通过云租赁的方式使用,这也让英伟达的开源策略带上了一层硬件生态的味道。

值得注意的是,VoiceChat的发布与OpenAI GPT-Live的正式上线几乎同期,两大阵营在同一个月内围绕实时语音交互展开交锋,一个走全双工架构闭源路线,一个走开放权重生态路线,语音Agent的技术路线之争由此正式拉开帷幕。

独立评测机构Artificial Analysis给出的数据显示,VoiceChat在Big Bench Audio上取得38.8%的成绩,是开源全双工模型中的最佳表现,领先Freeze-Omni的31.7%和Moshi的4.3%,在对话动力学上以77.8%位列第二。这也是唯一一个同时在两项指标上进入前三的开源权重模型,被评价为开源全双工语音的帕累托前沿领导者,说明开源语音模型在实时交互这条赛道上第一次站到了有竞争力的位置。

坦诚的局限与开源生态的意义

英伟达的模型文档坦诚得有些罕见。官方明确警告,模型经过多轮对话后可能退化为不可恢复的乱码,训练时音频上下文窗口不超过2分钟,超出范围的历史信息可能无法保留,只支持单一固定音色且不支持克隆,对嘈杂或混响环境不适用,输出可能提前结束,会话可能陷入单词或句子循环。这些诚实的局限,反而让开发者对模型的能力边界有了清晰预期,也避免了商业宣传式的话术包装。

从产业视角看,Nemotron VoiceChat的意义远超模型本身。英伟达在Nemotron系列上的策略一贯清晰:先开放权重让生态生长,再通过CUDA软件生态和DGX硬件体系变现。这款模型大概率就是这样的参考架构,它的存在将催生市场对推理优化GPU的需求,同时也为医疗问诊、课堂辅导、合规客服等数据不能出本地的语音场景,打开了一扇自托管实时语音Agent的大门。开源语音落后开源文本的时代,正在被英伟达亲手终结。

素材来源:Hugging Face、像素与芯片 发布时间:2026-08-05