STORY · 事件已收束

Gemini 3.5 Transcribe API 在 Google AI Studio 提供

2 个精选信源 · 2 篇报道持续 1最新动态 9天前
最新进展

官方指南补充支持 Smart/Verbatim 模式及最多 1000 个自定义术语。

DIGEST

事件全貌

AI 综述 · 更新于 7天前

Google 发布 Gemini 3.5 Transcribe 语音转文字模型,作为 Gemini Audio 家族新成员。该模型支持自动检测 85+ 种语言,可识别专业术语、自定义词汇表,并自动格式化文本、去除“um”“uh”等填充词。模型支持为最多三位说话人区分语音,并提供词级时间戳。API 现已在 Google AI Studio 和 Gemini Enterprise 中提供,开发者可通过 Gemini API 公开预览使用。

今日起向 macOS Gemini 应用用户开放英语版本,Android 上可通过 Rambler 应用试用。最新报道补充,相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,并已为 Pixel 11 上 Gboard 的“Rambler”功能提供支持。

The Decoder 报道称流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。MarkTechPost 报道称 85+ 语言平均 WER 为 2.6%,并通过 Interactions API 和 Live API 分别提供预录文件与双向流式处理。官方指南进一步说明,模型支持 Smart Transcription 与 Verbatim 两种模式,可通过 custom_vocabulary 传入最多 1,000 个领域术语。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

3 DAYS

本事件热度走势

当前热度 5峰值 188月29日 17:54近24小时下降 67%

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 0 条 · 最新在前
  1. Google 发布 Gemini 3.5 Transcribe 转录模型,可自动去除“um”“ah”等填充词
    The Verge:AI(RSS)

    Google 推出 Gemini Audio 家族新成员 Gemini 3.5 Transcribe,可自动识别专业术语和超过 85 种语言,并自动格式化文本、去除“um”“uh”等填充词。该模型支持自定义词汇表、为最多三位说话人区分语音,并提供词级时间戳。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。

  2. Gemini 3.5 Transcribe 发布,支持多语言转录
    X:Sundar Pichai (@sundarpichai)精选

    向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/