Gemini 3.5 Transcribe API 在 Gemini Enterprise 提供
新增性能数据:速度提升70%,错误率降至5.5%,并支持删除自我纠正内容。
事件全貌
Google 发布 Gemini 3.5 Transcribe 转录模型,支持自动检测 85+ 种语言、自定义专业术语词汇、区分最多三位说话人,并提供词级时间戳。
该模型可自动格式化文本并去除“um”“ah”等填充词,还能删除说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%。
API 现已在 Google AI Studio 和 Gemini Enterprise 中提供,开发者可通过 Gemini API 公开预览使用。macOS 上的 Gemini 应用用户今日起可使用英语版本,Android 上的 Rambler 应用也可试用。该模型已为 Pixel 11 上 Gboard 的“Rambler”功能提供支持,后续将进入更多谷歌产品。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
报道时间线
- 谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除“嗯”“呃”等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的“Rambler”功能提供支持,后续将进入更多谷歌产品。
- Google 发布 Gemini 3.5 Transcribe 转录模型,可自动去除“um”“ah”等填充词
Google 推出 Gemini Audio 家族新成员 Gemini 3.5 Transcribe,可自动识别专业术语和超过 85 种语言,并自动格式化文本、去除“um”“uh”等填充词。该模型支持自定义词汇表、为最多三位说话人区分语音,并提供词级时间戳。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。
- Gemini 3.5 Transcribe 发布,支持多语言转录
向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/