STORY · 事件已收束

Gemini 3.5 Transcribe 在 macOS 上的 Gemini 应用提供

2 个精选信源 · 2 篇报道持续 1最新动态 9天前
最新进展

Gemini 3.5 Transcribe 可通过 Live API 和 Interactions API 调用。

DIGEST

事件全貌

AI 综述 · 更新于 8天前

Google 发布 Gemini 3.5 Transcribe 语音转录模型,支持 85+ 种语言自动检测,可识别最多三位说话人并带时间戳,支持自定义专业词汇。API 已在 Google AI Studio 和 Gemini Enterprise 提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用。

同时发布 Transcribe Live API,面向流式传输,首个最终转录延迟 0.40 秒,词错率 4.0%。预录音频版在 Artificial Analysis 基准测试中 AA-WER 为 2.6%,排名第五,处理速度约 84 倍实时,价格约 $5 每千分钟;流式版价格约 $9 每千分钟。

最新报道确认该模型是 Google 最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 0 条 · 最新在前
  1. Gemini 3.5 Transcribe 发布,AA-WER 2.6% 排名第五
    X:Artificial Analysis (@ArtificialAnlys)

    Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live 两款 API:前者面向预录音频,AA-WER 2.6% 排名第五,处理速度约 84 倍实时;后者面向流式传输,首个最终转录延迟 0.40 秒,WER 4.0%。两者均支持 85+ 语言,预录版支持最多三人带时间戳的说话人识别,价格分别约 $5 与 $9 每千分钟。

  2. Gemini 3.5 Transcribe 发布,支持多语言转录
    X:Sundar Pichai (@sundarpichai)精选

    向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/