# Gemini 3.5 Transcribe 发布：更精准的实时语音转写模型

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：k9294
- 发布时间：2026-08-28 07:01
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmtc5i81401mlroosz6bsplf6
- 原文链接：https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe

## 精选理由

从 Chirp 3 到 3.5 Transcribe，流式 WER 降至 4% 且延迟改善 70%，让实时语音代理和字幕应用更接近可用的生产环境。

## AI 摘要

Google 推出 Gemini 3.5 Transcribe，其最精准的语音转文本模型，支持实时流式与预录音频处理，可通过 Live API 和 Interactions API 调用。

## 正文

智能转录：Gemini 3.5 Transcribe

我们最新的语音转文字模型，专为精准、智能的实时转录而设计。

Diego Melendo Casado

Gemini 音频工程高级总监

Luke Leonhard

Gemini 音频团队幕僚长，代表 Gemini 音频团队

今天，我们推出 Gemini 3.5 Transcribe——这是我们迄今最精准的语音转文字模型，专为智能语音交互而设计。与在背景噪音、复杂术语和口语不流畅清理方面表现不佳的传统语音识别模型不同，Gemini 3.5 Transcribe 能将原始音频直接转换为准确、精炼、格式规范的文本。

在我们的 Gemini 应用和 Android 等产品中，我们已经看到消费者通过这项转录模型受益，例如 Android 上的 Rambler 以及 macOS 上 Gemini 应用中的新语音功能。现在，开发者可以通过 Google AI Studio 中的 Gemini API 以及 Gemini 企业智能体平台，使用 Gemini 3.5 Transcribe 构建类似的功能。

我们构建 3.5 Transcribe 的目的在于无缝融入你的开发者工作流，无论你是在构建语音智能体、实时字幕工具，还是通话后分析管道。该模型通过两个独立的 API 提供：

实时流式传输：通过 Live API 使用 gemini-3.5-transcribe-live，提供亚秒级延迟的持续双向流式传输，适用于交互式语音应用。

预录音频处理：通过 Interactions API 使用 gemini-3.5-transcribe，转录录制的音频、会议、通话记录等，并支持说话人归属和词级时间戳。

获得更精准、更智能的转录

Gemini 3.5 Transcribe 旨在捕捉你的自然说话风格，以更好地理解你的意图并识别自定义词汇，让你可以用语音执行任务。

智能转录：无缝处理自我纠正（如“我们周二见面——不，周三”），去除填充词（“嗯”和“啊”），并自动格式化你的文本。

函数调用：该模型可以通过函数调用将复杂任务（如图像生成和文件分析）委派给其他 Gemini 模型。目前已在 Gemini macOS 应用中可用。

更精确的转写：根据 Artificial Analysis 的评测，该模型在流式场景下平均词错误率（WER）为 4.0%，非流式场景下为 2.6%。它在嘈杂的真实环境中表现出色，能够准确识别邮政编码和订单号等字母数字实体。

自定义词汇：通过无缝地将转写结果适配到你提供的自定义词汇，识别专业术语和特殊拼写。

全球语言支持：自动检测并转写超过 85 种语言，无缝处理地区口音和多样方言。

多说话人识别：在预录音频中准确区分说话人，并为最多三位说话人提供时间戳（支持 3 位以上说话人为实验性功能）。

Gemini 3.5 Transcribe 可处理实时语言切换，并提供无缝的流式转写。

观看 Gemini 3.5 Transcribe 如何通过智能转写功能清理语音不流畅问题。

3.5 Transcribe 提供带有多说话人归属和词级时间戳的转写。

Gemini 3.5 Transcribe 的性能标志着我们从之前的转写模型 Chirp 3 迈出的重大进步，带来了新功能、更低的词错误率和显著改善的延迟。根据 Artificial Analysis 的评测，例如，最终转写时间提升了 70%。在一组主要语言和地区的 FLEURS 基准测试中，该模型提供了精准的多语言性能，优于 Chirp 3，在流式模式下实现了 5.50% 的 WER，在非流式场景下实现了 5.04% 的 WER。

体验智能转写和高级听写。

除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 之外，3.5 Transcribe 还超越了标准语音转文本，让跨 Google 生态的工作体验更加自然直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常使用场景，它能够轻松捕捉细微差别、意图和内联编辑。

在 Android 版 Gboard 上，通过全新的 Rambler 功能，3.5 Transcribe 可将口述想法转换为格式规整的文本，并过滤掉口头禅。你还可以用语音进行编辑、纠正拼写错误以及调整写作风格。

在 Google Antigravity 上，3.5 Transcribe 会在获得你的许可后，结合屏幕上下文和聊天记录，确保对文件名、智能体思路和当前文档实现精准的转写准确度。

在 Google AI Studio 中，你可以在 Build 模式下使用 3.5 Transcribe，随时用语音即时编写 vibe code 应用。

在 macOS 版 Gemini 应用中，3.5 Transcribe 不仅能把你的自然语音转成整洁的格式化文本，还支持语音指令，可与屏幕上下文无缝配合，驱动复杂工作流。通过调用后台的其他 Gemini 模型来处理繁重任务，该模型让你仅凭语音，就能轻松总结本地文件、在应用间复用文本，或直接在光标处生成图片。

即将在 Chrome 中推出，你将可以在任意网页输入框中通过语音输入文字——无论是口述回复、撰写帖子，还是在 Chrome 中更自然、更轻松地用语音唤起 Gemini，都变得毫不费力。

Gemini 3.5 Transcribe 让你仅凭语音，就能在 macOS 版 Gemini 应用中分析文件、生成图片和执行搜索。

了解 Gemini 3.5 Transcribe 如何在 Android 上利用 Rambler 自动移除口头禅并清理语音内容。

Gemini 3.5 Transcribe 在 Google Antigravity 上利用屏幕上下文，确保转写准确度。

阅读早期评测

通过利用 Gemini Live API，Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台，让开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施，让开发者得以完全专注于打磨用户体验。

vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈，称赞其出色的延迟表现、准确度以及广泛的语言支持。

立即开始使用 3.5 Transcribe

面向开发者：现已在 Gemini API 中公开预览，可通过 Google AI Studio 和 Google Antigravity 使用。

面向企业：现已在 Gemini Enterprise Agent Platform 中公开预览，并将很快在 Gemini Enterprise for Customer Experience 中推出。

面向所有用户：现已在 macOS 版 Gemini 应用中提供英文版本，在部分国家和语言的 Android 版 Rambler 中提供，并将很快在 Chrome 中推出。
