Gemma 4 12B:开发者指南

Google Developers Blog(RSS)·2026-06-03 00:00·88天前
AI 导读

Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

Google Developers Blog(RSS)
精选
78AI 编辑部评分,满分 100

Gemma 4 12B:开发者指南

2026-06-03 00:00· 88天前
AI 导读

Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

推荐理由

Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

正文 · AI 翻译
placeholder

继我们发布博客中的公告之后,我们正式发布 Gemma 4 12B,这是一个采用统一、无编码器架构的密集多模态模型。

Gemma 4 12B 为本地 AI 带来了多项里程碑式突破:

  1. 多模态无编码器架构:完全绕过繁重的多阶段视觉和音频编码器,多模态数据直接输入大语言模型主干,从而降低多模态延迟。
  2. 我们首款支持音频输入的中等规模模型:在 Gemma 系列中,此前音频输入仅限于小型、轻量级的边缘架构(例如 E4B)。Gemma 4 12B 是首款能够原生接收音频的中等规模模型。
  3. 对开发者友好的尺寸:模型足够小,可在配备 16GB VRAM 或统一内存的专用 GPU 笔记本电脑上本地运行。为最大化本地推理速度,我们还额外发布了一款专用的多 token 预测(MTP)模型。
  4. 全新的 MacOS 桌面体验:我们首次发布可下载的 macOS 桌面应用程序,让开发者能够在消费级设备上直接体验完全本地的语音和视觉交互。

架构

传统多模态模型依赖冻结的、独立的视觉编码器(例如,Gemma 4 在边缘尺寸模型中使用 1.5 亿参数的视觉模型,在中等尺寸模型中使用 5.5 亿参数)和音频编码器(Gemma 4 E2B 和 E4B 使用 3 亿参数)。在将多模态输入送入大语言模型之前,使用多个独立编码器进行处理,会导致延迟增加和内存占用碎片化。

Gemma 4 12B 通过采用一个仅解码器的 Transformer 来解决这些问题,该 Transformer 包含与 Gemma 4 31B 密集模型相同的先进解码器结构。

overview
  • 视觉嵌入器(3500 万参数):取代了其他中等尺寸 Gemma 4 模型中的 27 层视觉 Transformer。原始的 48x48 像素块通过单次矩阵乘法(matmul)被投影到大语言模型的隐藏维度。一个分解的坐标查找(X 和 Y 矩阵)将空间位置信息直接附加到输入上。
  • 音频波形投影:消除了独立的音频编码器(跳过了 Gemma 4 E2B 和 E4B 中使用的 12 层 Conformer 层)。原始的 16 kHz 音频信号被切片为 40 毫秒的帧(每帧 640 个浮点数),并线性投影到大语言模型的输入空间。
  • 统一微调优势:由于视觉、音频和文本输入共享完全相同的权重,你不再需要协同调整多个独立的冻结编码器。下游适配器(例如 LoRA)或全量微调能够自然地通过单次传递(借助 Hugging Face 或 Unsloth)更新整个多模态 token 循环。

如需更深入地了解这种免编码器架构的工作原理,请参阅《Gemma 4 12B 可视化指南》。

能力

Gemma 4 12B 实现了卓越的性能,具备自动语音识别、智能体推理、说话人分离、视频理解、编程等多种能力。

请参阅以下示例,了解该模型的智能体与多模态能力演示:

示例 1:Gemma 4 12B 创建一个使用 Gemma 4 12B 的本地图像处理应用

凭借其智能体与多模态理解能力,Gemma 4 12B 可以轻松与 OpenCode 等现有智能体框架配合使用。在此示例中,我们使用 llama.cpp 通过 gemma-skills 在本地部署该模型,编写了一个帮助用户处理图像的 Gradio 应用。这个应用正是由构建它的同一个 Gemma 4 12B 模型驱动的!

示例 2:以 1 FPS 处理带音频的 5 分钟视频

我们使用 Gemma 4 12B 分析了 5 月 19 日 Google IO 主题演讲中的一个片段,具体是 00:15:32 到 00:20:45 之间的 5 分钟内容。为此,我们提取了该片段的所有帧(以 1 FPS 速率),以及提示词和视频中的音频:

提示词:

  1. 313 帧(以 1FPS 速率,图像大小调整为视觉 token 预算 70)
  2. “当那个男人自拍时发生了什么?”
  3. 视频的音频 + 下方的提示词
在这些演示视频中,当男子拍摄“自拍照”或展示自己手持智能手机放在脸前时,这是一种巧妙的方式,用视觉手段来表现AI模型如何利用现有媒体(如个人照片或视频片段)并对其进行“重新构想”。在这些特定片段中,模型会获取一张自拍照,并将其作为基础来生成各种场景(例如一个人身处空间站,或正在森林中行走)。本质上,这名男子并非真的在拍自拍,而是**在演绎一个视觉隐喻,用以表现AI的能力——即接收一个特定输入(一张“自拍照”),并基于它生成一整个全新的内容世界。** 这是Gemini Omni模型“替换”和“构建世界”演示的一部分,展示了其执行复杂多模态推理和创意生成的能力。

设备端与桌面端服务:由LiteRT-LM驱动

随着Gemma 4 12B的发布,我们正式推出了由LiteRT-LM驱动的强大设备端开发者集成功能,将零延迟的本地AI执行能力原生带入标准桌面环境:

1. 原生macOS应用:移动端的Google AI Edge Gallery正式扩展到桌面平台,可在Apple Silicon GPU上离线原生运行Gemma 4 12B。它附带一个安全的沙盒化Python执行循环,能够在聊天气泡内编写、执行代码并绘制科学图表。与此同时,Mac上的Google AI Edge Eloquent应用也新增了对Gemma 12B的支持,为语音编辑对话输入提供动力。

2. 即插即用的本地API服务器(litert-lm serve):使用新的`litert-lm serve` CLI命令,将Gemma 4 12B作为兼容OpenAI的本地API服务器运行。无缝连接标准集成(例如Continue、Aider、OpenClaw、Hermes或OpenCode),利用内存中的无状态前缀缓存来匹配上下文历史记录,从而立即绕过预填充延迟。

litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm  gemma-4-12B-it.litertlm gemma4-12b

# Start the OpenAI-compatible server
litert-lm serve

请访问Google AI Edge Gallery博客,深入了解相关内容。

即刻开始

准备好使用Gemma系列首个无编码器架构来构建本地多模态智能体了吗?以下是你今天就可以开始的方法。

  • 亲自试试:在 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent 应用以及 LiteRT-LM CLI 中,只需点击几下即可体验。
  • 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调的检查点。
  • 集成与学习:查阅开发者文档和快速入门笔记本。
  • 使用你喜爱的开发工具:通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管线,或使用 Unsloth 高效微调。
  • 借助 Gemma Skills 开启智能体开发:为支持开发者利用最新的 Gemma 进展构建智能体,我们正式发布了官方 Skills Repository。这是一个专门为让智能体能够使用 Gemma 模型进行构建而设计的技能库。
  • 按需部署:使用 Google Cloud 在生产环境中启动端点。通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 按需部署。
  • AI
  • 公告
  • 探索
  • 多模态
  • Gemma
  • AI