HuggingFace Daily Papers(社区热门论文)
精选
80AI 编辑部评分,满分 100

DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

2026-07-31 08:00· 4天前
跳到正文
精选理由

扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。

AI 摘要

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

正文 · AI 翻译

我们推出 DiffusionGemma,这是一款实验性的开放权重语言模型,利用离散扩散技术以极高速度生成文本。DiffusionGemma 并非逐 token 解码,而是并行迭代精炼 256 个 token 的块,从而绕开传统自回归(AR)大语言模型的顺序解码瓶颈。我们并非从零训练,而是通过对 Gemma 4 混合专家模型进行微调得到 DiffusionGemma,该模型激活参数为 3.8B,总参数为 25.2B。我们计算高效的两阶段训练流程所用训练 token 预算不足原始 AR 模型总预算的 10%。第一阶段使用监督微调来教授双向去噪,第二阶段则将强化学习与采样器蒸馏相结合,共同提升生成质量与推理效率。DiffusionGemma 在生成速度与模型能力之间的权衡上确立了新的帕累托前沿。在我们的完整评测套件上取平均,它每次前向传播可生成约 20 个 token,在单块 NVIDIA H100 GPU 上每秒可输出约 1,500 个 token,即便与采用最先进推测解码的 AR 模型相比也明显更快。DiffusionGemma 还保留了原始模型对思考模式、多模态输入和长上下文的支持。尽管经过扩散微调,它仍能以仅轻微的性能下降进行 AR 生成,这为混合扩散-AR 解码指明了一条路径。

DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

HuggingFace Daily Papers(社区热门论文)·2026-07-31 08:00·4天前
阅读原文· arxiv.org(在新标签页打开)
精选理由

扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。

AI 摘要

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

正文 · AI 翻译

我们推出 DiffusionGemma,这是一款实验性的开放权重语言模型,利用离散扩散技术以极高速度生成文本。DiffusionGemma 并非逐 token 解码,而是并行迭代精炼 256 个 token 的块,从而绕开传统自回归(AR)大语言模型的顺序解码瓶颈。我们并非从零训练,而是通过对 Gemma 4 混合专家模型进行微调得到 DiffusionGemma,该模型激活参数为 3.8B,总参数为 25.2B。我们计算高效的两阶段训练流程所用训练 token 预算不足原始 AR 模型总预算的 10%。第一阶段使用监督微调来教授双向去噪,第二阶段则将强化学习与采样器蒸馏相结合,共同提升生成质量与推理效率。DiffusionGemma 在生成速度与模型能力之间的权衡上确立了新的帕累托前沿。在我们的完整评测套件上取平均,它每次前向传播可生成约 20 个 token,在单块 NVIDIA H100 GPU 上每秒可输出约 1,500 个 token,即便与采用最先进推测解码的 AR 模型相比也明显更快。DiffusionGemma 还保留了原始模型对思考模式、多模态输入和长上下文的支持。尽管经过扩散微调,它仍能以仅轻微的性能下降进行 AR 生成,这为混合扩散-AR 解码指明了一条路径。

阅读原文arxiv.org(在新标签页打开)