Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

HuggingFace Daily Papers(社区热门论文)·2026-07-07 08:00·48天前
AI 导读

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

2026-07-07 08:00· 48天前
AI 导读

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。

推荐理由

NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。

正文 · AI 翻译

我们推出 Nemotron-Labs-Diffusion,这是一种三模式语言模型,在单一架构内统一了自回归、扩散和自推测解码。通过联合自回归-扩散目标进行训练,Nemotron-Labs-Diffusion 能够切换模式,在不同部署场景和并发水平下维持高吞吐量。我们的研究表明:(1) 自回归与扩散目标是互补的:扩散改进了前瞻规划能力,而自回归则提供了从左到右的语言先验。(2) 在自推测模式下,扩散负责草稿生成,自回归负责验证,在接收率和实际设备效率上均优于多 token 预测方法。(3) 光速分析进一步展示了扩散的长期潜力,在最优采样器下,每次前向传播可生成比自推测多 76.5% 的 token。我们的 Nemotron-Labs-Diffusion 系列模型规模扩展至 3B、8B 和 14B 参数,包括基础版、指令版和视觉语言版,在准确率和速度上均持续优于最先进的开源自回归和扩散语言模型。例如,Nemotron-Labs-Diffusion-8B 每次前向传播生成的 token 数量是 Qwen3-8B 的 6 倍,且准确率相当,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时,吞吐量提升了 4 倍。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org