# DiffusionGemma 技术报告：基于离散扩散的高效文本生成模型

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-31 08:00
- AIHOT 分数：80
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmseazfg20k6gro2ezmd4a6qt
- 原文链接：https://arxiv.org/abs/2608.00146

## 精选理由

扩散生成首次在文本领域将吞吐推高至约1500 token/s，此前这类速度仅见于非文本生成架构，为实时交互和批量生成场景提供了新的可行上限。

## AI 摘要

DiffusionGemma 是一个实验性开源权重语言模型，通过离散扩散并行迭代精炼 256 个 token 的块，而非逐 token 解码，从而避免自回归模型的顺序解码瓶颈。

## 正文

我们推出 DiffusionGemma，这是一款实验性的开放权重语言模型，利用离散扩散技术以极高速度生成文本。DiffusionGemma 并非逐 token 解码，而是并行迭代精炼 256 个 token 的块，从而绕开传统自回归（AR）大语言模型的顺序解码瓶颈。我们并非从零训练，而是通过对 Gemma 4 混合专家模型进行微调得到 DiffusionGemma，该模型激活参数为 3.8B，总参数为 25.2B。我们计算高效的两阶段训练流程所用训练 token 预算不足原始 AR 模型总预算的 10%。第一阶段使用监督微调来教授双向去噪，第二阶段则将强化学习与采样器蒸馏相结合，共同提升生成质量与推理效率。DiffusionGemma 在生成速度与模型能力之间的权衡上确立了新的帕累托前沿。在我们的完整评测套件上取平均，它每次前向传播可生成约 20 个 token，在单块 NVIDIA H100 GPU 上每秒可输出约 1,500 个 token，即便与采用最先进推测解码的 AR 模型相比也明显更快。DiffusionGemma 还保留了原始模型对思考模式、多模态输入和长上下文的支持。尽管经过扩散微调，它仍能以仅轻微的性能下降进行 AR 生成，这为混合扩散-AR 解码指明了一条路径。
