OpenAI 发布 GPT-Live-Transcribe
GPT-Transcribe 在 AA-WER 基准上词错误率 3.31%,较前代降低 0.7 个百分点。
事件全貌
OpenAI 于 2026 年 7 月 28 日通过 API 推出两款新转录模型:GPT-Live-Transcribe 和 GPT-Transcribe。GPT-Live-Transcribe 专为低延迟实时转录设计,定价每分钟 0.017 美元;GPT-Transcribe 针对异步转录优化,处理预录音频速度约为实时 34 倍,定价每分钟 0.0045 美元(即每千分钟 4.50 美元)。两款模型均能更好理解上下文,在跨口音、语言、背景噪音等场景下提升准确率。
在性能方面,GPT-Transcribe 在 Common Voice 22 种语言上的词错误率为 19.27%,远低于 Whisper 的 40.37%;在 AA-WER 基准上词错误率为 3.31%,较前代降低 0.7 个百分点,排名第 9。模型支持文本提示、关键词及多语言提示三种上下文。
目前所有报道均来自官方及第三方评测,未出现矛盾或反转信息。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
报道时间线
- OpenAI 推出 GPT Transcribe 和 GPT Live Transcribe 语音识别模型
OpenAI 通过 API 推出 GPT Transcribe 和 GPT Live Transcribe 两款新语音识别模型。GPT Transcribe 处理预录音频的速度约为实时的 34 倍,词错误率为 3.31%,较前代降低 0.7 个百分点,定价降至每分钟 $0.0045。
- OpenAI 发布 GPT Transcribe 非流式语音转录模型
OpenAI 推出非流式语音转录模型 GPT Transcribe,在 AA-WER 基准上词错误率为 3.31%(排名第 9),较前代提升 0.7 个百分点。该模型支持文本提示、关键词及多语言提示三种上下文,处理速度约达实时 34 倍,定价降至每千分钟音频 $4.50。
- OpenAI 推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,支持 API 调用
OpenAI 发布 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,通过 API 调用。前者专为低延迟实时转录设计,每分钟 0.017 美元;后者优化异步转录,每分钟 0.0045 美元。在 Common Voice 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,低于 Whisper (whisper-1) 的 40.37%。
- OpenAI 推出两款新转录模型 API
我们在 API 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。