Google DeepMind:Blog(RSS)
精选
80AI 编辑部评分,满分 100

Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

2026-06-09 22:10· 56天前· Olivier Lacombe
AI 导读

Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

推荐理由

统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

正文 · AI 翻译

推出 Gemma 4 12B:一款统一的无编码器多模态模型

Gemma 4 12B 旨在将高性能多模态智能直接带到你的笔记本电脑上,融合了移动优先的效率与先进的推理能力。

Olivier Lacombe

Google DeepMind 产品管理总监

Gus Martins

今天,我们推出 Gemma 4 12B,这是我们最新的模型,旨在将智能体多模态智能直接带到笔记本电脑上。Gemma 4 12B 填补了面向边缘设备的 E4B 与更先进的 26B 混合专家模型(MoE)之间的空白,在更小的内存占用内封装了强大的能力。它也是我们首款原生支持音频输入的中型模型。

得益于开发者社区,Gemma 4 系列模型现已突破 1.5 亿次下载。你们用它构建了从可穿戴机械臂(用于物理辅助)到企业级 AI 安全系统等各类应用。我们很期待看到你们用这款最新模型能创造出什么。

以下是 Gemma 4 12B 的独特之处概览:

  • 新颖的统一架构:无需多模态编码器。视觉和音频输入直接流入大语言模型主干。
  • 先进的推理能力:基准测试性能接近我们的 26B 模型,解锁了强大的多步推理和智能体工作流。
  • 适配笔记本电脑:体积小巧,仅需 16GB 显存或统一内存即可本地运行。
  • 开放且易用:采用 Apache 2.0 许可证发布,并得到整个开发者生态系统的支持。
  • 为投机解码而生:Gemma 4 12B 配备了多 token 预测(MTP)草稿模型,可降低延迟。

这些特性共同将先进的多模态能力带到了日常硬件上,同时不牺牲速度或推理能力。现在,让我们更深入地了解 Gemma 4 12B 是如何实现这一点的。

在本地运行最先进的智能体

Gemma 4 12B 在标准基准测试中提供了接近我们更大的 26B MoE 模型的性能,但总内存占用不到后者的一半。它体积小巧,可在配备 16GB 内存的消费级笔记本电脑上本地运行,从而在你的机器上解锁强大的多模态和智能体体验。

体验一种独特高效、统一的架构

Gemma 4 12B 的突出之处在于其处理视觉和音频输入的简化方法。传统多模态模型通常依赖独立的编码器来转换图像和音频,然后再将这些表征传递给语言模型。由于这种分离式编码器会增加延迟和内存占用,我们采用无编码器架构训练了 Gemma 4 12B,使其能够直接整合音频和视觉输入。

以下是 Gemma 4 12B 原生处理多模态输入的方式:

  • 视觉:我们用轻量级嵌入模块替换了 Gemma 4 的视觉编码器,该模块仅包含单次矩阵乘法、位置嵌入和归一化操作。这使得大语言模型主干能够接管视觉处理任务。
  • 音频:我们进一步简化了音频处理流程。我们完全移除了音频编码器,并将原始音频信号直接投影到与文本 token 相同的维度空间中。

想要了解详细分解的开发者,请查阅我们的配套文档《Gemma 4 12B 开发者指南》。

查看原生音频处理的实际效果:观看 Gemma 4 12B 如何完全离线地使用 Google AI Edge Eloquent 应用对语音输入进行转录、格式化和翻译。

立即开始

  • 亲自尝试:在 LM Studio、Ollama、Google AI Edge Gallery 应用、Google AI Edge Eloquent 应用以及 LiteRT-LM CLI 中,只需点击几下即可进行实验。
  • 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调后的检查点。
  • 集成与学习:查阅开发者文档和快速入门笔记本。
  • 使用你喜爱的开发工具:通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管线,或使用 Unsloth 进行高效微调。
  • 使用 Gemma Skills 解锁智能体开发:为支持开发者利用最新的 Gemma 进展构建智能体,我们发布了官方 Skills 仓库。这是一个专门为智能体使用 Gemma 模型进行开发而设计的技能库。
  • 按需部署:使用 Google Cloud 在生产环境中启动端点。通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 按需部署。

来源:Google DeepMind:Blog(RSS) · deepmind.google

同一事件 · 6

Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

Google DeepMind:Blog(RSS)·2026-06-09 22:10·56天前·Olivier Lacombe
AI 导读

Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

正文 · AI 翻译

推出 Gemma 4 12B:一款统一的无编码器多模态模型

Gemma 4 12B 旨在将高性能多模态智能直接带到你的笔记本电脑上,融合了移动优先的效率与先进的推理能力。

Olivier Lacombe

Google DeepMind 产品管理总监

Gus Martins

今天,我们推出 Gemma 4 12B,这是我们最新的模型,旨在将智能体多模态智能直接带到笔记本电脑上。Gemma 4 12B 填补了面向边缘设备的 E4B 与更先进的 26B 混合专家模型(MoE)之间的空白,在更小的内存占用内封装了强大的能力。它也是我们首款原生支持音频输入的中型模型。

得益于开发者社区,Gemma 4 系列模型现已突破 1.5 亿次下载。你们用它构建了从可穿戴机械臂(用于物理辅助)到企业级 AI 安全系统等各类应用。我们很期待看到你们用这款最新模型能创造出什么。

以下是 Gemma 4 12B 的独特之处概览:

  • 新颖的统一架构:无需多模态编码器。视觉和音频输入直接流入大语言模型主干。
  • 先进的推理能力:基准测试性能接近我们的 26B 模型,解锁了强大的多步推理和智能体工作流。
  • 适配笔记本电脑:体积小巧,仅需 16GB 显存或统一内存即可本地运行。
  • 开放且易用:采用 Apache 2.0 许可证发布,并得到整个开发者生态系统的支持。
  • 为投机解码而生:Gemma 4 12B 配备了多 token 预测(MTP)草稿模型,可降低延迟。

这些特性共同将先进的多模态能力带到了日常硬件上,同时不牺牲速度或推理能力。现在,让我们更深入地了解 Gemma 4 12B 是如何实现这一点的。

在本地运行最先进的智能体

Gemma 4 12B 在标准基准测试中提供了接近我们更大的 26B MoE 模型的性能,但总内存占用不到后者的一半。它体积小巧,可在配备 16GB 内存的消费级笔记本电脑上本地运行,从而在你的机器上解锁强大的多模态和智能体体验。

体验一种独特高效、统一的架构

Gemma 4 12B 的突出之处在于其处理视觉和音频输入的简化方法。传统多模态模型通常依赖独立的编码器来转换图像和音频,然后再将这些表征传递给语言模型。由于这种分离式编码器会增加延迟和内存占用,我们采用无编码器架构训练了 Gemma 4 12B,使其能够直接整合音频和视觉输入。

以下是 Gemma 4 12B 原生处理多模态输入的方式:

  • 视觉:我们用轻量级嵌入模块替换了 Gemma 4 的视觉编码器,该模块仅包含单次矩阵乘法、位置嵌入和归一化操作。这使得大语言模型主干能够接管视觉处理任务。
  • 音频:我们进一步简化了音频处理流程。我们完全移除了音频编码器,并将原始音频信号直接投影到与文本 token 相同的维度空间中。

想要了解详细分解的开发者,请查阅我们的配套文档《Gemma 4 12B 开发者指南》。

查看原生音频处理的实际效果:观看 Gemma 4 12B 如何完全离线地使用 Google AI Edge Eloquent 应用对语音输入进行转录、格式化和翻译。

立即开始

  • 亲自尝试:在 LM Studio、Ollama、Google AI Edge Gallery 应用、Google AI Edge Eloquent 应用以及 LiteRT-LM CLI 中,只需点击几下即可进行实验。
  • 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调后的检查点。
  • 集成与学习:查阅开发者文档和快速入门笔记本。
  • 使用你喜爱的开发工具:通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管线,或使用 Unsloth 进行高效微调。
  • 使用 Gemma Skills 解锁智能体开发:为支持开发者利用最新的 Gemma 进展构建智能体,我们发布了官方 Skills 仓库。这是一个专门为智能体使用 Gemma 模型进行开发而设计的技能库。
  • 按需部署:使用 Google Cloud 在生产环境中启动端点。通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 按需部署。

来源:Google DeepMind:Blog(RSS)· deepmind.google

同一事件 · 6