# NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-08-10 07:58
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u
- 原文链接：https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling

## 精选理由

端到端语音模型消除级联延迟，而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期，让实时语音智能体更容易工程化。

## AI 摘要

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型，通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开，但仅限研究用途，需单张 80 GB 显存 GPU，目前无托管 API。

## 正文

NVIDIA 发布了 NemotronLabs VoiceChat 11B，这是一个开放的 11B 端到端语音到语音模型，用于实时全双工对话。它不再串联 ASR、LLM 和 TTS，而是在一个统一网络中完成流式语音理解和语音生成。这消除了级联架构所需的多模型编排和 API 交接，并降低了端到端延迟：在 Full-Duplex-Bench 1.0 上测得的平滑轮换延迟为 448 ms。该模型可以边听边说，因此用户可以在对话中途插话，智能体会让出话语权，在 480 ms 时接管率为 1.00。它也是首个在对话持续进行时支持工具调用的开放全双工模型，使用独立的输出通道输出 `<TOOLCALL>` 脚本，并配合操作员定义的“保持”话术，在 API 运行期间填补空档。

它可以部署吗？

部分可行——目前可用于试点，不适合生产环境。权重和容器均已公开，许可证也较为宽松。但 NVIDIA 团队表示该检查点“仅用于研究目的”，且代码库中记录了真实的失败模式：两分钟的音频上下文上限、多轮对话后退化为不可恢复的乱码、一轮结束后出现失控的自言自语，以及用户转写中的词语丢失。

哪些公司适用：任何能够分配一块至少 80 GB 显存的 GPU 的团队——在 x86_64 Linux 上的 A100、H100、RTX 6000 Pro 或 B200。这涵盖 AI 原生初创公司、已获融资的成长期企业、企业研发与创新实验室、GPU 云服务商以及高校语音研究组。目前没有托管 API，也没有推理服务商提供该模型，因此没有 GPU 资源的团队可能无法进行评估。

行业：联络中心和客户体验平台、汽车座舱助手、零售和得来速点餐、电信 IVR 现代化、游戏和 NPC 对话，以及无障碍辅助工具。

应用场景：支持插话的语音智能体、基于内部 API 的语音前端、实时查询助手（天气、价格、订单状态），以及全双工延迟基准测试工具。

架构

该模型是 Mamba/Transformer 混合架构，由 NVIDIA 现有的三个组件加上一条新的输出路径组装而成。

来自 Nemotron-Speech-Streaming-En-0.6b 的快速 Conformer 语音编码器，可连续编码输入的 16 kHz 音频流。

NVIDIA Nemotron Nano v2 大语言模型主干，负责消费音频 token 并预测文本 token。

NVIDIA TTS 解码器和编解码器，用于预测音频码，渲染为 22.05 kHz 的智能体语音。

一个专门用于工具调用脚本的独立输出通道。

输出包括智能体音频、智能体文本以及持续更新的用户转写文本。训练使用了约 55 万小时的音频数据，涵盖真实与合成语料库，基于 SALM-Duplex 和 Audio Flamingo 3 构建。

无静默期的工具调用

工具调用通过侧通道以 `<TOOLCALL>` 块的形式发出；你的代码通过 `<TOOL_RESPONSE>` 块返回结果。其中值得注意的部分是“保持通话”消息：针对每个工具，操作员可以定义一句台词，当模型生成触发调用的文本时，智能体立即说出这句台词，这样在 API 运行期间对话不会陷入沉默。

限制条件非常明确。NVIDIA 建议每个会话最多使用五个工具，模型无法可靠地同时调用多个工具，并且在工具执行期间用户无法打断智能体。系统提示词和工具响应必须仅包含 ASCII 字符，并且适合 TTS 合成。

性能表现

在 Full-Duplex-Bench 1.0 上：流畅轮换 TOR 为 0.82（448 毫秒），用户打断 TOR 为 1.00（480 毫秒），暂停处理 TOR 为 0.153（合成数据）和 0.255（Candor 数据），数值越低越好。

在 AU Harness BFCL-v3 口语工具调用测试中：简单场景 58.5%，多工具场景 62.5%，并行场景 42.5%，并行多工具场景 27.5%，无关性 89.6%，平均 56.1%。在 Full-Duplex-Bench v3 上：工具选择 82.5%，参数准确率 44.2%，pass@1 为 33%。

NVIDIA 报告称，该模型在 VoiceBench 上位列开源全双工模型第二，在 Full-Duplex-Bench 1.0 上位列开源模型第二。

交互式演示

核心要点

一个 11B 模型取代了 ASR → LLM → TTS 的完整链路，实测轮换延迟为 448 毫秒。

首款支持工具调用的开源全双工模型，采用侧通道加操作员定义的保持通话消息机制。

权重采用 OpenMDW-1.1 宽松许可，但 NVIDIA 将该检查点标记为仅限研究用途。

需要一块 80 GB 显存的 GPU；目前尚无托管 API 可用。

欢迎查看 Hugging Face 模型卡、GitHub（NeMo Speech）和 NGC 容器。此外，欢迎在 Twitter 上关注我们，别忘了加入我们超过 15 万成员的 ML SubReddit，并订阅我们的新闻通讯。等等！你在用 Telegram 吗？现在你也可以在 Telegram 上找到我们了。
