MarkTechPost(RSS)
精选
75AI 编辑部评分,满分 100

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

2026-08-10 07:58· 1天前· Asif Razzaq
AI 导读

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

推荐理由

端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

正文 · AI 翻译

NVIDIA 发布了 NemotronLabs VoiceChat 11B,这是一个开放的 11B 端到端语音到语音模型,用于实时全双工对话。它不再串联 ASR、LLM 和 TTS,而是在一个统一网络中完成流式语音理解和语音生成。这消除了级联架构所需的多模型编排和 API 交接,并降低了端到端延迟:在 Full-Duplex-Bench 1.0 上测得的平滑轮换延迟为 448 ms。该模型可以边听边说,因此用户可以在对话中途插话,智能体会让出话语权,在 480 ms 时接管率为 1.00。它也是首个在对话持续进行时支持工具调用的开放全双工模型,使用独立的输出通道输出 `<TOOLCALL>` 脚本,并配合操作员定义的“保持”话术,在 API 运行期间填补空档。

它可以部署吗?

部分可行——目前可用于试点,不适合生产环境。权重和容器均已公开,许可证也较为宽松。但 NVIDIA 团队表示该检查点“仅用于研究目的”,且代码库中记录了真实的失败模式:两分钟的音频上下文上限、多轮对话后退化为不可恢复的乱码、一轮结束后出现失控的自言自语,以及用户转写中的词语丢失。

  • 哪些公司适用:任何能够分配一块至少 80 GB 显存的 GPU 的团队——在 x86_64 Linux 上的 A100、H100、RTX 6000 Pro 或 B200。这涵盖 AI 原生初创公司、已获融资的成长期企业、企业研发与创新实验室、GPU 云服务商以及高校语音研究组。目前没有托管 API,也没有推理服务商提供该模型,因此没有 GPU 资源的团队可能无法进行评估。
  • 行业:联络中心和客户体验平台、汽车座舱助手、零售和得来速点餐、电信 IVR 现代化、游戏和 NPC 对话,以及无障碍辅助工具。
  • 应用场景:支持插话的语音智能体、基于内部 API 的语音前端、实时查询助手(天气、价格、订单状态),以及全双工延迟基准测试工具。

架构

该模型是 Mamba/Transformer 混合架构,由 NVIDIA 现有的三个组件加上一条新的输出路径组装而成。

  • 来自 Nemotron-Speech-Streaming-En-0.6b 的快速 Conformer 语音编码器,可连续编码输入的 16 kHz 音频流。
  • NVIDIA Nemotron Nano v2 大语言模型主干,负责消费音频 token 并预测文本 token。
  • NVIDIA TTS 解码器和编解码器,用于预测音频码,渲染为 22.05 kHz 的智能体语音。
  • 一个专门用于工具调用脚本的独立输出通道。

输出包括智能体音频、智能体文本以及持续更新的用户转写文本。训练使用了约 55 万小时的音频数据,涵盖真实与合成语料库,基于 SALM-Duplex 和 Audio Flamingo 3 构建。

无静默期的工具调用

工具调用通过侧通道以 `<TOOLCALL>` 块的形式发出;你的代码通过 `<TOOL_RESPONSE>` 块返回结果。其中值得注意的部分是“保持通话”消息:针对每个工具,操作员可以定义一句台词,当模型生成触发调用的文本时,智能体立即说出这句台词,这样在 API 运行期间对话不会陷入沉默。

限制条件非常明确。NVIDIA 建议每个会话最多使用五个工具,模型无法可靠地同时调用多个工具,并且在工具执行期间用户无法打断智能体。系统提示词和工具响应必须仅包含 ASCII 字符,并且适合 TTS 合成。

性能表现

在 Full-Duplex-Bench 1.0 上:流畅轮换 TOR 为 0.82(448 毫秒),用户打断 TOR 为 1.00(480 毫秒),暂停处理 TOR 为 0.153(合成数据)和 0.255(Candor 数据),数值越低越好。

在 AU Harness BFCL-v3 口语工具调用测试中:简单场景 58.5%,多工具场景 62.5%,并行场景 42.5%,并行多工具场景 27.5%,无关性 89.6%,平均 56.1%。在 Full-Duplex-Bench v3 上:工具选择 82.5%,参数准确率 44.2%,pass@1 为 33%。

NVIDIA 报告称,该模型在 VoiceBench 上位列开源全双工模型第二,在 Full-Duplex-Bench 1.0 上位列开源模型第二。

交互式演示

核心要点

  • 一个 11B 模型取代了 ASR → LLM → TTS 的完整链路,实测轮换延迟为 448 毫秒。
  • 首款支持工具调用的开源全双工模型,采用侧通道加操作员定义的保持通话消息机制。
  • 权重采用 OpenMDW-1.1 宽松许可,但 NVIDIA 将该检查点标记为仅限研究用途。
  • 需要一块 80 GB 显存的 GPU;目前尚无托管 API 可用。

欢迎查看 Hugging Face 模型卡、GitHub(NeMo Speech)和 NGC 容器。此外,欢迎在 Twitter 上关注我们,别忘了加入我们超过 15 万成员的 ML SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。

来源:MarkTechPost(RSS) · marktechpost.com

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

MarkTechPost(RSS)·2026-08-10 07:58·1天前·Asif Razzaq
AI 导读

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

正文 · AI 翻译

NVIDIA 发布了 NemotronLabs VoiceChat 11B,这是一个开放的 11B 端到端语音到语音模型,用于实时全双工对话。它不再串联 ASR、LLM 和 TTS,而是在一个统一网络中完成流式语音理解和语音生成。这消除了级联架构所需的多模型编排和 API 交接,并降低了端到端延迟:在 Full-Duplex-Bench 1.0 上测得的平滑轮换延迟为 448 ms。该模型可以边听边说,因此用户可以在对话中途插话,智能体会让出话语权,在 480 ms 时接管率为 1.00。它也是首个在对话持续进行时支持工具调用的开放全双工模型,使用独立的输出通道输出 `<TOOLCALL>` 脚本,并配合操作员定义的“保持”话术,在 API 运行期间填补空档。

它可以部署吗?

部分可行——目前可用于试点,不适合生产环境。权重和容器均已公开,许可证也较为宽松。但 NVIDIA 团队表示该检查点“仅用于研究目的”,且代码库中记录了真实的失败模式:两分钟的音频上下文上限、多轮对话后退化为不可恢复的乱码、一轮结束后出现失控的自言自语,以及用户转写中的词语丢失。

  • 哪些公司适用:任何能够分配一块至少 80 GB 显存的 GPU 的团队——在 x86_64 Linux 上的 A100、H100、RTX 6000 Pro 或 B200。这涵盖 AI 原生初创公司、已获融资的成长期企业、企业研发与创新实验室、GPU 云服务商以及高校语音研究组。目前没有托管 API,也没有推理服务商提供该模型,因此没有 GPU 资源的团队可能无法进行评估。
  • 行业:联络中心和客户体验平台、汽车座舱助手、零售和得来速点餐、电信 IVR 现代化、游戏和 NPC 对话,以及无障碍辅助工具。
  • 应用场景:支持插话的语音智能体、基于内部 API 的语音前端、实时查询助手(天气、价格、订单状态),以及全双工延迟基准测试工具。

架构

该模型是 Mamba/Transformer 混合架构,由 NVIDIA 现有的三个组件加上一条新的输出路径组装而成。

  • 来自 Nemotron-Speech-Streaming-En-0.6b 的快速 Conformer 语音编码器,可连续编码输入的 16 kHz 音频流。
  • NVIDIA Nemotron Nano v2 大语言模型主干,负责消费音频 token 并预测文本 token。
  • NVIDIA TTS 解码器和编解码器,用于预测音频码,渲染为 22.05 kHz 的智能体语音。
  • 一个专门用于工具调用脚本的独立输出通道。

输出包括智能体音频、智能体文本以及持续更新的用户转写文本。训练使用了约 55 万小时的音频数据,涵盖真实与合成语料库,基于 SALM-Duplex 和 Audio Flamingo 3 构建。

无静默期的工具调用

工具调用通过侧通道以 `<TOOLCALL>` 块的形式发出;你的代码通过 `<TOOL_RESPONSE>` 块返回结果。其中值得注意的部分是“保持通话”消息:针对每个工具,操作员可以定义一句台词,当模型生成触发调用的文本时,智能体立即说出这句台词,这样在 API 运行期间对话不会陷入沉默。

限制条件非常明确。NVIDIA 建议每个会话最多使用五个工具,模型无法可靠地同时调用多个工具,并且在工具执行期间用户无法打断智能体。系统提示词和工具响应必须仅包含 ASCII 字符,并且适合 TTS 合成。

性能表现

在 Full-Duplex-Bench 1.0 上:流畅轮换 TOR 为 0.82(448 毫秒),用户打断 TOR 为 1.00(480 毫秒),暂停处理 TOR 为 0.153(合成数据)和 0.255(Candor 数据),数值越低越好。

在 AU Harness BFCL-v3 口语工具调用测试中:简单场景 58.5%,多工具场景 62.5%,并行场景 42.5%,并行多工具场景 27.5%,无关性 89.6%,平均 56.1%。在 Full-Duplex-Bench v3 上:工具选择 82.5%,参数准确率 44.2%,pass@1 为 33%。

NVIDIA 报告称,该模型在 VoiceBench 上位列开源全双工模型第二,在 Full-Duplex-Bench 1.0 上位列开源模型第二。

交互式演示

核心要点

  • 一个 11B 模型取代了 ASR → LLM → TTS 的完整链路,实测轮换延迟为 448 毫秒。
  • 首款支持工具调用的开源全双工模型,采用侧通道加操作员定义的保持通话消息机制。
  • 权重采用 OpenMDW-1.1 宽松许可,但 NVIDIA 将该检查点标记为仅限研究用途。
  • 需要一块 80 GB 显存的 GPU;目前尚无托管 API 可用。

欢迎查看 Hugging Face 模型卡、GitHub(NeMo Speech)和 NGC 容器。此外,欢迎在 Twitter 上关注我们,别忘了加入我们超过 15 万成员的 ML SubReddit,并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。

来源:MarkTechPost(RSS)· marktechpost.com