Google DeepMind:Blog(RSS)
精选
72AI 编辑部评分,满分 100

DiffusionGemma:文本生成速度提升4倍的开源扩散模型

2026-06-11 00:24· 67天前
AI 导读

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

推荐理由

DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

正文 · AI 翻译

我们最新的开放实验模型在专用 GPU 上可实现高达 4 倍的推理速度提升,为探索对速度敏感的交互式本地工作流打开了大门。

B

Brendan O'Donoghue

研究科学家

S

Sebastian Flennerhag

研究科学家

今天,我们推出 DiffusionGemma,这是一款探索文本扩散技术的实验性开放模型,采用了一种异常快速的文本生成方法。该模型基于 Apache 2.0 许可证发布,是一个 26B 参数的混合专家(MoE)模型,它突破了传统自回归大语言模型(LLM)逐 token 顺序处理的模式,而是同时生成整段文本,在 GPU 上实现了高达 4 倍的文本生成速度提升。

DiffusionGemma 基于我们 Gemma 4 系列业界领先的每参数智能水平以及尖端的 Gemini 扩散研究成果构建,集成了一个旨在最大化生成速度的新型扩散头。虽然自回归的 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索对速度敏感的交互式本地工作流的研究人员和开发者设计,例如行内编辑、快速迭代以及生成非线性文本结构。

为开发者解锁新价值

构建实时交互式 AI 应用的开发者常常受困于本地推理的延迟瓶颈。DiffusionGemma 直接应对这些挑战,并带来一些关键的权衡:

  • 极速推理:通过将解码瓶颈从内存带宽转移到计算能力,DiffusionGemma 在专用 GPU 上可实现高达 4 倍的 token 输出速度提升。(在单块 NVIDIA H100 上每秒可生成 1000+ token,在 NVIDIA GeForce RTX 5090 上每秒可生成 700+ token)。¹
  • 可及的硬件门槛:作为总参数量为 26B 的混合专家(MoE)模型,DiffusionGemma 在推理时仅激活 3.8B 参数,量化后可轻松适配高端专用消费级 GPU 的 18GB VRAM 限制。
  • 双向注意力:每次前向传播可并行生成 256 个 token,使每个 token 都能关注到所有其他 token。这为非线性领域(如行内编辑、代码填充、氨基酸序列或数学图结构)带来了显著优势。
  • 智能自我修正:模型会迭代优化自身输出,使其能够一次性评估整个文本块,从而实时修正错误。
  • 实验状态与生产建议:由于优先考虑速度和并行布局生成,DiffusionGemma 的整体输出质量低于标准版 Gemma 4。对于追求最高质量的应用场景,我们建议部署标准版 Gemma 4。

你可以通过微调来提升 DiffusionGemma 在特定任务上的表现。在下面的示例中,Unsloth 对 DiffusionGemma 进行了微调,使其能够玩数独游戏——这是自回归模型难以胜任的任务,因为每个 token 都依赖于后续 token。而 DiffusionGemma 的双向注意力机制让这一任务变得容易得多。

微调后的 DiffusionGemma 正在解数独。

为什么要在文本领域采用扩散模型?

尽管 AI 研究界多年来一直在探索基于扩散模型的文本生成技术,但将其应用于大模型始终是一大挑战。DiffusionGemma 通过改变模型使用硬件的方式,打破了这一局面。

传统模型的权衡取舍

大多数语言模型的工作方式像打字机一样,从左到右逐个生成 token。在云端运行时,这种方式效率很高,因为服务器可以将数千个用户请求批量处理,共同分担硬件负载。但当在本地为单个用户运行时,这种逐字生成的方式会导致你专用的 GPU 或 TPU 利用率不足——大部分时间它只是在等待下一次"按键"。

DiffusionGemma 扭转了这种低效局面。它不再按顺序预测单词,而是同时草拟出整个 256 token 的段落。通过让计算机处理器一次性处理更大的任务块,DiffusionGemma 能够充分发挥你的硬件潜力。它将模型推理从一台单线程的打字机,升级为一台能够同时印刷整个文本块的巨型印刷机。

Hugging Face 的 DiffusionGemma 文本转 3D SVG 演示。逐步生成过程。

这意味着 DiffusionGemma 的速度提升是为本地和低并发推理场景设计的。在高 QPS 的云端服务中,自回归模型可以通过部署来高效饱和计算资源,因此 DiffusionGemma 的并行解码带来的收益递减,并可能导致更高的服务成本。其吞吐量优势在单个加速器上的中低批次规模时最为显著。

文本扩散的工作原理

类似于 AI 图像生成器从视觉噪点开始,逐步迭代优化成清晰图像,DiffusionGemma 将此过程应用于文本:

  1. 画布:模型从一个由随机占位 token 组成的画布开始。
  2. 迭代优化:模型进行多次遍历,锁定正确的 token,并将它们作为上下文线索来优化其余部分。
  3. 最终润色:文本收敛为高质量输出。

由于模型可以在生成的同时处理整个段落,它解锁了新的模型行为模式,例如完美闭合复杂的 Markdown 格式,或近乎实时地生成并渲染代码。

立即开始使用

  • 下载权重:立即在 Hugging Face 上获取实验性模型权重(基于宽松的 Apache 2.0 许可证发布)。
  • 集成与学习:在我们的 DiffusionGemma 开发者指南中了解更多。或者深入阅读《DiffusionGemma 可视化指南》,以理解其底层机制。
  • 使用您喜爱的开发工具:通过 MLX、vLLM(由 Red Hat 支持集成)以及 Hugging Face Transformers 高效地部署模型。为了快速实验,我们发布了一份使用 Hackable Diffusion(一个专为可组合性设计的模块化 JAX 工具箱)的微调教程。您还可以探索使用 Unsloth 和 NVIDIA NeMo 进行微调。此外,对 llama.cpp 的官方支持即将推出。
  • 体验优化后的性能:我们与 NVIDIA 合作,在其硬件堆栈上进行了全面优化,既确保了对消费级设备的兼容性(针对 GeForce RTX 5090 和 4090 GPU 进行了量化处理),也在企业级系统上实现了高性能(利用先进的 NVFP4 内核支持 Hopper 和 Blackwell 架构),包括用于本地桌面部署的 NVIDIA DGX Spark 和 DGX Station,以及面向 AI 专业人士的 RTX PRO。对 NVFP4(4 位浮点数)的原生支持加速了计算吞吐量,使模型能够以更快的速度运行,同时保持近乎无损的精度。
  • 按你的方式尝试:在你的桌面专用 GPU 上运行,或通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云端运行。

来源:Google DeepMind:Blog(RSS) · deepmind.google

事件后续 · 2查看事件全部 →

DiffusionGemma:文本生成速度提升4倍的开源扩散模型

Google DeepMind:Blog(RSS)·2026-06-11 00:24·67天前
AI 导读

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

正文 · AI 翻译

我们最新的开放实验模型在专用 GPU 上可实现高达 4 倍的推理速度提升,为探索对速度敏感的交互式本地工作流打开了大门。

B

Brendan O'Donoghue

研究科学家

S

Sebastian Flennerhag

研究科学家

今天,我们推出 DiffusionGemma,这是一款探索文本扩散技术的实验性开放模型,采用了一种异常快速的文本生成方法。该模型基于 Apache 2.0 许可证发布,是一个 26B 参数的混合专家(MoE)模型,它突破了传统自回归大语言模型(LLM)逐 token 顺序处理的模式,而是同时生成整段文本,在 GPU 上实现了高达 4 倍的文本生成速度提升。

DiffusionGemma 基于我们 Gemma 4 系列业界领先的每参数智能水平以及尖端的 Gemini 扩散研究成果构建,集成了一个旨在最大化生成速度的新型扩散头。虽然自回归的 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索对速度敏感的交互式本地工作流的研究人员和开发者设计,例如行内编辑、快速迭代以及生成非线性文本结构。

为开发者解锁新价值

构建实时交互式 AI 应用的开发者常常受困于本地推理的延迟瓶颈。DiffusionGemma 直接应对这些挑战,并带来一些关键的权衡:

  • 极速推理:通过将解码瓶颈从内存带宽转移到计算能力,DiffusionGemma 在专用 GPU 上可实现高达 4 倍的 token 输出速度提升。(在单块 NVIDIA H100 上每秒可生成 1000+ token,在 NVIDIA GeForce RTX 5090 上每秒可生成 700+ token)。¹
  • 可及的硬件门槛:作为总参数量为 26B 的混合专家(MoE)模型,DiffusionGemma 在推理时仅激活 3.8B 参数,量化后可轻松适配高端专用消费级 GPU 的 18GB VRAM 限制。
  • 双向注意力:每次前向传播可并行生成 256 个 token,使每个 token 都能关注到所有其他 token。这为非线性领域(如行内编辑、代码填充、氨基酸序列或数学图结构)带来了显著优势。
  • 智能自我修正:模型会迭代优化自身输出,使其能够一次性评估整个文本块,从而实时修正错误。
  • 实验状态与生产建议:由于优先考虑速度和并行布局生成,DiffusionGemma 的整体输出质量低于标准版 Gemma 4。对于追求最高质量的应用场景,我们建议部署标准版 Gemma 4。

你可以通过微调来提升 DiffusionGemma 在特定任务上的表现。在下面的示例中,Unsloth 对 DiffusionGemma 进行了微调,使其能够玩数独游戏——这是自回归模型难以胜任的任务,因为每个 token 都依赖于后续 token。而 DiffusionGemma 的双向注意力机制让这一任务变得容易得多。

微调后的 DiffusionGemma 正在解数独。

为什么要在文本领域采用扩散模型?

尽管 AI 研究界多年来一直在探索基于扩散模型的文本生成技术,但将其应用于大模型始终是一大挑战。DiffusionGemma 通过改变模型使用硬件的方式,打破了这一局面。

传统模型的权衡取舍

大多数语言模型的工作方式像打字机一样,从左到右逐个生成 token。在云端运行时,这种方式效率很高,因为服务器可以将数千个用户请求批量处理,共同分担硬件负载。但当在本地为单个用户运行时,这种逐字生成的方式会导致你专用的 GPU 或 TPU 利用率不足——大部分时间它只是在等待下一次"按键"。

DiffusionGemma 扭转了这种低效局面。它不再按顺序预测单词,而是同时草拟出整个 256 token 的段落。通过让计算机处理器一次性处理更大的任务块,DiffusionGemma 能够充分发挥你的硬件潜力。它将模型推理从一台单线程的打字机,升级为一台能够同时印刷整个文本块的巨型印刷机。

Hugging Face 的 DiffusionGemma 文本转 3D SVG 演示。逐步生成过程。

这意味着 DiffusionGemma 的速度提升是为本地和低并发推理场景设计的。在高 QPS 的云端服务中,自回归模型可以通过部署来高效饱和计算资源,因此 DiffusionGemma 的并行解码带来的收益递减,并可能导致更高的服务成本。其吞吐量优势在单个加速器上的中低批次规模时最为显著。

文本扩散的工作原理

类似于 AI 图像生成器从视觉噪点开始,逐步迭代优化成清晰图像,DiffusionGemma 将此过程应用于文本:

  1. 画布:模型从一个由随机占位 token 组成的画布开始。
  2. 迭代优化:模型进行多次遍历,锁定正确的 token,并将它们作为上下文线索来优化其余部分。
  3. 最终润色:文本收敛为高质量输出。

由于模型可以在生成的同时处理整个段落,它解锁了新的模型行为模式,例如完美闭合复杂的 Markdown 格式,或近乎实时地生成并渲染代码。

立即开始使用

  • 下载权重:立即在 Hugging Face 上获取实验性模型权重(基于宽松的 Apache 2.0 许可证发布)。
  • 集成与学习:在我们的 DiffusionGemma 开发者指南中了解更多。或者深入阅读《DiffusionGemma 可视化指南》,以理解其底层机制。
  • 使用您喜爱的开发工具:通过 MLX、vLLM(由 Red Hat 支持集成)以及 Hugging Face Transformers 高效地部署模型。为了快速实验,我们发布了一份使用 Hackable Diffusion(一个专为可组合性设计的模块化 JAX 工具箱)的微调教程。您还可以探索使用 Unsloth 和 NVIDIA NeMo 进行微调。此外,对 llama.cpp 的官方支持即将推出。
  • 体验优化后的性能:我们与 NVIDIA 合作,在其硬件堆栈上进行了全面优化,既确保了对消费级设备的兼容性(针对 GeForce RTX 5090 和 4090 GPU 进行了量化处理),也在企业级系统上实现了高性能(利用先进的 NVFP4 内核支持 Hopper 和 Blackwell 架构),包括用于本地桌面部署的 NVIDIA DGX Spark 和 DGX Station,以及面向 AI 专业人士的 RTX PRO。对 NVFP4(4 位浮点数)的原生支持加速了计算吞吐量,使模型能够以更快的速度运行,同时保持近乎无损的精度。
  • 按你的方式尝试:在你的桌面专用 GPU 上运行,或通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云端运行。

来源:Google DeepMind:Blog(RSS)· deepmind.google

事件后续 · 2查看事件全部 →