# 英伟达发布 Audex 统一音频-文本模型，避免多模态扩展后文本能力下滑

- 来源：IT之家（RSS）
- 发布时间：2026-07-08 13:53
- AIHOT 分数：57
- AIHOT 链接：https://aihot.virxact.com/items/cmrbopeq105uyihl1sv1lwsk5
- 原文链接：https://www.ithome.com/0/973/992.htm

## AI 摘要

英伟达今年6月推出 Audex（Nemotron-Labs-Audex-30B-A3B）统一音频-文本大语言模型，总参数30B、激活参数3B。骨干为52层混合 Mamba-Transformer 结构的 Nemotron-Cascade-2-30B-A3B，含128个可路由专家、每次激活6个。音频输入经 AF-Whisper 编码后映射到文本嵌入空间，输出词表从131072个 token 扩展至205312个。语音输出采用 X-Codec2（每秒50 token，单层有限标量量化），非语音音频采用 X-Codec（每秒200 token，4层展平残差向量量化）。文本评测方面，Audex 在 MMLU-Redux 得分86.4（骨干86.3），IMO AnswerBench 得分81.1（骨干79.3），MMLU-Pro 与 GPQA-Diamond 小幅下降。

## 正文

IT之家 7 月 8 日消息，英伟达于今年 6 月发表论文，推出 Audex（Nemotron-Labs-Audex-30B-A3B）统一音频-文本大语言模型，总参数量 30B，激活参数 3B，在保留核心文本智能情况下，能理解和生成音频（audio）和语音（speech）。

该模型骨干为文本模型 Nemotron-Cascade-2-30B-A3B，后者为 52 层混合 Mamba-Transformer 结构，包含 128 个可路由专家、每次激活 6 个专家。

该模型的设计目标是避免多模态扩展后文本能力下滑问题。论文显示，Audex 将音频输入编码后映射到文本嵌入空间，并把量化后的音频输出标记与文本标记统一处理。

在音频组件上，Audex 使用 AF-Whisper（音频编码器）处理 16kHz 输入，配合两层 MLP 适配器映射特征，输出词表从原始 131072 个 Token 扩展至 205312 个 Tokens。

语音输出采用 X-Codec2（语音编解码器），速率为每秒 50 个标记，使用单层 finite scalar quantization（有限标量量化），码本大小为 65536。非语音音频采用 X-Codec（音频编解码器），速率为每秒 200 个标记，使用 4 层展平残差向量量化。

文本评测方面，Audex 在 MMLU-Redux 上得分 86.4，高于骨干模型的 86.3；在 IMO AnswerBench 上为 81.1，高于骨干的 79.3，但在 MMLU-Pro 与 GPQA-Diamond 上出现小幅下降。

Unified Audio Intelligence Without Regressing on Text Intelligence
