Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型

Hacker News 热门(buzzing.cc 中文翻译)·2026-08-28 07:01·3小时前·k9294
AI 导读

Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。

Hacker News 热门(buzzing.cc 中文翻译)
精选
73AI 编辑部评分,满分 100

Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型

2026-08-28 07:01· 3小时前· k9294
AI 导读

Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。

推荐理由

从 Chirp 3 到 3.5 Transcribe,流式 WER 降至 4% 且延迟改善 70%,让实时语音代理和字幕应用更接近可用的生产环境。

正文 · AI 翻译

智能转录:Gemini 3.5 Transcribe

我们最新的语音转文字模型,专为精准、智能的实时转录而设计。


Diego Melendo Casado

Gemini 音频工程高级总监

Luke Leonhard

Gemini 音频团队幕僚长,代表 Gemini 音频团队


Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background

今天,我们推出 Gemini 3.5 Transcribe——这是我们迄今最精准的语音转文字模型,专为智能语音交互而设计。与在背景噪音、复杂术语和口语不流畅清理方面表现不佳的传统语音识别模型不同,Gemini 3.5 Transcribe 能将原始音频直接转换为准确、精炼、格式规范的文本。

在我们的 Gemini 应用和 Android 等产品中,我们已经看到消费者通过这项转录模型受益,例如 Android 上的 Rambler 以及 macOS 上 Gemini 应用中的新语音功能。现在,开发者可以通过 Google AI Studio 中的 Gemini API 以及 Gemini 企业智能体平台,使用 Gemini 3.5 Transcribe 构建类似的功能。

我们构建 3.5 Transcribe 的目的在于无缝融入你的开发者工作流,无论你是在构建语音智能体、实时字幕工具,还是通话后分析管道。该模型通过两个独立的 API 提供:

  • 实时流式传输:通过 Live API 使用 gemini-3.5-transcribe-live,提供亚秒级延迟的持续双向流式传输,适用于交互式语音应用。
  • 预录音频处理:通过 Interactions API 使用 gemini-3.5-transcribe,转录录制的音频、会议、通话记录等,并支持说话人归属和词级时间戳。

获得更精准、更智能的转录

Gemini 3.5 Transcribe 旨在捕捉你的自然说话风格,以更好地理解你的意图并识别自定义词汇,让你可以用语音执行任务。

  • 智能转录:无缝处理自我纠正(如“我们周二见面——不,周三”),去除填充词(“嗯”和“啊”),并自动格式化你的文本。
  • 函数调用:该模型可以通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前已在 Gemini macOS 应用中可用。
  • 更精确的转写:根据 Artificial Analysis 的评测,该模型在流式场景下平均词错误率(WER)为 4.0%,非流式场景下为 2.6%。它在嘈杂的真实环境中表现出色,能够准确识别邮政编码和订单号等字母数字实体。
  • 自定义词汇:通过无缝地将转写结果适配到你提供的自定义词汇,识别专业术语和特殊拼写。
  • 全球语言支持:自动检测并转写超过 85 种语言,无缝处理地区口音和多样方言。
  • 多说话人识别:在预录音频中准确区分说话人,并为最多三位说话人提供时间戳(支持 3 位以上说话人为实验性功能)。

Gemini 3.5 Transcribe 可处理实时语言切换,并提供无缝的流式转写。

观看 Gemini 3.5 Transcribe 如何通过智能转写功能清理语音不流畅问题。

3.5 Transcribe 提供带有多说话人归属和词级时间戳的转写。

Gemini 3.5 Transcribe 的性能标志着我们从之前的转写模型 Chirp 3 迈出的重大进步,带来了新功能、更低的词错误率和显著改善的延迟。根据 Artificial Analysis 的评测,例如,最终转写时间提升了 70%。在一组主要语言和地区的 FLEURS 基准测试中,该模型提供了精准的多语言性能,优于 Chirp 3,在流式模式下实现了 5.50% 的 WER,在非流式场景下实现了 5.04% 的 WER。

Graph of streaming speech recognition accuracy Graph of streaming speech recognition accuracy

体验智能转写和高级听写。

除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 之外,3.5 Transcribe 还超越了标准语音转文本,让跨 Google 生态的工作体验更加自然直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常使用场景,它能够轻松捕捉细微差别、意图和内联编辑。

  • 在 Android 版 Gboard 上,通过全新的 Rambler 功能,3.5 Transcribe 可将口述想法转换为格式规整的文本,并过滤掉口头禅。你还可以用语音进行编辑、纠正拼写错误以及调整写作风格。
  • 在 Google Antigravity 上,3.5 Transcribe 会在获得你的许可后,结合屏幕上下文和聊天记录,确保对文件名、智能体思路和当前文档实现精准的转写准确度。
  • 在 Google AI Studio 中,你可以在 Build 模式下使用 3.5 Transcribe,随时用语音即时编写 vibe code 应用。
  • 在 macOS 版 Gemini 应用中,3.5 Transcribe 不仅能把你的自然语音转成整洁的格式化文本,还支持语音指令,可与屏幕上下文无缝配合,驱动复杂工作流。通过调用后台的其他 Gemini 模型来处理繁重任务,该模型让你仅凭语音,就能轻松总结本地文件、在应用间复用文本,或直接在光标处生成图片。
  • 即将在 Chrome 中推出,你将可以在任意网页输入框中通过语音输入文字——无论是口述回复、撰写帖子,还是在 Chrome 中更自然、更轻松地用语音唤起 Gemini,都变得毫不费力。

Gemini 3.5 Transcribe 让你仅凭语音,就能在 macOS 版 Gemini 应用中分析文件、生成图片和执行搜索。

了解 Gemini 3.5 Transcribe 如何在 Android 上利用 Rambler 自动移除口头禅并清理语音内容。

Gemini 3.5 Transcribe 在 Google Antigravity 上利用屏幕上下文,确保转写准确度。

阅读早期评测

通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,让开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者得以完全专注于打磨用户体验。

vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,称赞其出色的延迟表现、准确度以及广泛的语言支持。

vivo testimonial IntelliTek testimonial Lingopal testimonial Stream testimonial Agora testimonial fishjam testimonial

立即开始使用 3.5 Transcribe

  • 面向开发者:现已在 Gemini API 中公开预览,可通过 Google AI Studio 和 Google Antigravity 使用。
  • 面向企业:现已在 Gemini Enterprise Agent Platform 中公开预览,并将很快在 Gemini Enterprise for Customer Experience 中推出。
  • 面向所有用户:现已在 macOS 版 Gemini 应用中提供英文版本,在部分国家和语言的 Android 版 Rambler 中提供,并将很快在 Chrome 中推出。