STORY · 事件进行中

Google DeepMind 发布 Gemini 3.5 Transcribe

5 个精选信源 · 5 篇报道持续 1最新动态 1小时前
最新进展

Gemini 3.5 Transcribe 今日向 macOS Gemini 应用用户开放英语版本,开发者可通过 API 公开预览使用。

DIGEST

事件全貌

AI 综述 · 更新于 40分钟前

Google DeepMind 于 2026 年 8 月 26 日发布 Gemini 3.5 Transcribe,一款面向实时语音交互的高精度语音转文本模型。该模型支持流式与非流式两种 API,据 Artificial Analysis 评测,流式平均词错率为 4.0%,非流式为 2.6%。

模型支持超过 85 种语言自动检测、自定义词汇适配专业术语,以及最多三人说话人识别。此外,它具备智能转写、函数调用、自动过滤语气词、格式化非结构化语音,并能结合屏幕上下文执行语音指令,甚至利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。

API 已在 Google AI Studio 和 Gemini Enterprise 中提供,用户也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

24 HOURS

本事件热度走势

当前热度 86峰值 868月27日 03:01近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。

TIMELINE

报道时间线

5 条公开报道 · 官方一手 2 条 · 最新在前
  1. Google 发布 Gemini 3.5 Transcribe 转录模型,可自动去除“um”“ah”等填充词
    The Verge:AI(RSS)

    Google 推出 Gemini Audio 家族新成员 Gemini 3.5 Transcribe,可自动识别专业术语和超过 85 种语言,并自动格式化文本、去除“um”“uh”等填充词。该模型支持自定义词汇表、为最多三位说话人区分语音,并提供词级时间戳。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。

  2. Gemini 3.5 Transcribe 发布,精准语音转写
    X:Google AI (@GoogleAI)官方一手

    Google 推出 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言,可自动过滤语气词、格式化非结构化语音,并结合屏幕上下文执行语音指令。该模型还能利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。

  3. Gemini 3.5 Transcribe 发布,支持实时流式转写
    X:Logan Kilpatrick (@OfficialLoganK)

    推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精准的转写(更低 WER)、自定义词汇支持、多说话人识别,并支持超过 85 种语言! 同时支持实时流式传输!

  4. Gemini 3.5 Transcribe 发布,支持多语言转录
    X:Sundar Pichai (@sundarpichai)

    向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

  5. Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型
    Google DeepMind:Blog(RSS)官方一手精选

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。