英伟达开源全双工语音模型VoiceChat 11B,用户插话打断响应仅需半秒

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

语音交互正在从一问一答的机器人式对话,走向可以随时插话、边听边说的自然交流。8月3日,英伟达正式开源NemotronLabs VoiceChat 11B,这是其首个端到端全双工语音对话模型,参数规模110亿。它最大的特点,是把传统的语音识别、语言理解、语音合成三级流水线压缩进一个统一网络,实现流式语音理解与生成的同步进行。测试数据显示,其平滑话轮切换延迟低至448毫秒,用户中途插话时系统能在约480毫秒内交还话语权。

更值得注意的是,这是首个支持在对话过程中调用工具的开源全双工模型。语音智能体在查询订单、搜索知识库、调用业务接口时,可以边说话边干活,无需等待外部接口返回结果而陷入沉默。英伟达将权重以宽松的OpenMDW-1.1协议公开在Hugging Face上,面向智能体、车载语音、智能客服、人形机器人等场景开放,为开源语音生态补上了一块关键拼图。

一个模型取代三级流水线,全双工交互如何成为可能

传统语音助手的工作方式是接力赛:自动语音识别先把声音转成文字,大语言模型据此生成回答,语音合成再把文字读出来。每一棒交接都会增加延迟,而且整套流水线只能严格轮流发言,系统说话时无法同时听用户说话。VoiceChat 11B彻底改变了这一架构,用一个端到端的流式网络直接完成语音到语音的理解与生成,省去了多模型之间的数据转换和等待时间。

从技术构成看,这个模型像是一套精心组装的积木:来自英伟达0.6B流式语音模型的Fast Conformer编码器负责处理16kHz音频输入,Nemotron Nano v2 9B混合Mamba与Transformer架构作为推理主干,英伟达自研TTS解码器与流式编解码器输出22.05kHz音频,另有一个RNN-T解码器并行生成用户语音的实时转录文本。工具调用脚本通过独立输出通道发送,不会污染语音回答内容。

全双工能力的核心价值在于交互体验。用户可以在模型回答过程中随时补充条件、提出新问题,系统检测到新的语音输入后立即停止当前回答,重新理解并回应。在Full-Duplex-Bench 1.0基准上,其平滑话轮切换得分0.82,用户插话接管率在480毫秒时达到1.00。这意味着对话节奏更接近真人交流,语音助手从被动应答走向主动交互成为可能。

448毫秒背后,55万小时训练与工具调用双通道设计

支撑448毫秒低延迟的,是庞大的训练投入。英伟达用约55万小时音频训练了这个模型,语料包括合成TTS输出、Fisher、LibriVox、LibriTTS、HiFi-TTS、VCTK等公开语料库,以及内部录音室数据。在Artificial Analysis的评测中,VoiceChat 11B在Big Bench Audio上取得38.8%的成绩,位居所有开源全双工模型之首,领先Freeze-Omni的31.7%和PersonaPlex的19.1%,同时在对话动态性上以77.8%排名第二。

工具调用是它最独特的卖点。模型引入独立输出通道输出工具调用脚本,并支持开发者预设过渡话术。当智能体发起外部API请求时,系统可以通过侧通道播放设定的提示内容,比如客服在查询订单时先告知用户系统正在处理,避免长时间静默等待。在AU Harness BFCL-v3口语工具调用测试中,其整体得分56.1%,简单场景58.5%,多调用场景62.5%,无关检测89.6%,表现中规中矩。

但工具调用也暴露了当前的技术边界。Full-Duplex-Bench v3上,模型选择正确工具的概率为82.5%,但参数生成准确率仅44.2%,端到端通过率33%。英伟达官方建议单次会话不超过5个工具,模型无法可靠地并行调用多个工具,工具执行期间用户也不能打断。这些限制意味着,距离生产级语音智能体仍有相当距离,研究验证的性质非常明确。

开源不等于免费,80GB显存门槛与研发级限制

部署门槛是开发者绕不开的现实。VoiceChat 11B高效运行需要单张至少80GB显存的GPU,如A100、H100、RTX 6000 Pro或B200,且运行环境为x86_64 Linux。普通消费级显卡基本无法直接承载完整模型,这意味着只有拥有数据中心级算力的团队才能尝鲜。更关键的是,英伟达官方将模型标注为仅限研究用途,目前没有托管API,也没有成熟的推理服务提供商接入。

官方文档还如实记录了模型的已知故障模式:音频上下文时长上限约为两分钟,超出后可能降级;多轮对话后语音可能退化为不可恢复的乱码;回合结束后可能出现失控的自言自语;用户转录过程中会偶发单词丢失。这些短板与限制条件一道,划定了模型的适用范围:适合联络中心、汽车座舱、零售点餐、电信IVR、无障碍辅助等场景的受控试点,而非直接替换生产级语音平台。

即便如此,开源本身的意义不容低估。长期以来,开源语音模型与闭源商业方案之间存在明显差距,端到端语音模型的构建复杂度远超纯文本模型。VoiceChat 11B是第一个把全双工对话与智能体工具调用作为统一问题开放出来的模型,为语音智能体的研究与开发提供了可下载、可检查、可微调的基座。对于医疗问诊、课堂辅导、合规客服等音频不能离场的场景,这套开放方案的价值将在未来逐步释放。

素材来源:AIBase、前沿在线、智章百科 发布时间:2026-08-11