新一代实时语音模型,能够在人们说话时进行推理、翻译和转写。
我们在 API 中推出了三款音频模型,为开发者解锁了一类全新的语音应用。借助这些模型,开发者可以构建更自然、响应更智能、并能实时采取行动的语音体验:
- GPT-Realtime-2,这是我们首款具备 GPT-5 级别推理能力的语音模型,能够处理更复杂的请求,并自然地推进对话。
- GPT-Realtime-Translate,一款全新的实时翻译模型,可将 70 多种输入语言的语音翻译成 13 种输出语言,且与说话者保持同步。
- GPT-Realtime-Whisper,一款全新的流式语音转文本模型,可在说话者讲话时实时转写语音。
试用 GPT-Realtime-2
开始会话,然后与 GPT-Realtime-2 自然对话。
开始会话
我可以问些什么?
开始会话后,可以尝试说出以下其中一项:
- 我今晚要临时办一场晚宴。我只有 30 分钟,两位素食朋友,一位不吃蘑菇,还有一个很小的厨房。帮我计划一个简单的菜单。
- 我正在日本迎接一场现场活动的来宾。用日语说一段温暖自然的欢迎词——就像主持人开启一场特别活动那样。
- 我的订单号是 Orbit-742Q。请清晰地复述一遍,以便我确认无误。
- 帮我练习如何告诉团队我们达成了发布里程碑。先用沉稳自信的语气说,再用更兴奋的语气说一遍。
- 我正在为一次公路旅行策划问答游戏。给我三个听起来出奇简单但容易上当的陷阱题,然后用一句话解释每个答案。
此演示有时限。使用即表示您同意 OpenAI 的条款并确认我们的隐私政策。
语音正成为人们使用软件最自然的方式之一。它让人可以在开车时寻求帮助、在穿过机场时更改旅行计划、用自己偏好的语言获得支持,或者无需停下来打字就能完成一项任务。
但构建有用的语音产品,需要的不仅仅是快速的对话轮换或听起来自然的语音。一个语音智能体需要理解说话人的意图、跟踪上下文、在请求发生变化时进行恢复、在对话持续进行的同时使用工具,并以一种贴合当下情境的方式做出回应。
我们推出的这些模型共同将实时音频从简单的问答模式,转变为能够真正执行任务的语音界面:在对话展开的过程中进行倾听、推理、翻译、转录和采取行动。
语音作为人与产品之间的交互界面
随着语音成为使用软件的一种更自然的方式,我们看到开发者正围绕语音 AI 中的三种新兴模式进行构建:
- **语音到行动**,即人们可以描述自己的需求,系统能够推理该请求、使用工具并完成任务。例如,Zillow 正在构建一个助手,它可以倾听、推理并对诸如“在我的购房能力范围内找房子,避开繁忙街道,并安排周六看房”这样的请求采取行动。
- **系统到语音**,即软件可以将上下文转化为实时的语音指导。例如,一个旅行应用可以主动告诉旅行者:“您的进港航班延误了,但您仍然可以赶上转机。我找到了新的登机口,规划了穿过航站楼的最快路线,并且您的行李预计仍能顺利转运。”
- **语音到语音**,即 AI 可以帮助实时对话跨越语言、任务或不断变化的上下文持续进行。例如,Deutsche Telekom 正在构建语音支持体验,客户可以使用他们最熟悉的语言说话,而模型则实时翻译对话。
这些模式也可以协同工作。Priceline 正致力于实现这样一个未来:旅行者可以通过语音管理整个行程——以对话方式搜索航班和酒店,处理诸如航班延误后调整酒店预订等变更,获取 TSA 安检等待时间的实时更新,并在旅行者落地后进行对话翻译。
实时语音:帮助语音模型进行推理和采取行动
GPT-Realtime-2 专为实时语音交互而构建,模型在处理请求、调用工具、应对纠正或打断时,能保持对话流畅推进,并以贴合当下情境的方式做出回应。
- 前导语:开发者可以启用主回复前的简短语句,例如“让我查一下”或“请稍等,我查查看”,让用户知道智能体正在处理请求。
- 并行工具调用与工具透明度:模型可以同时调用多个工具,并通过“正在查看你的日历”或“正在查询”等语句让这些操作可闻,帮助智能体在完成任务的同时保持响应性。
- 更强的恢复行为:模型能以更优雅的方式恢复对话,例如说出“我现在遇到了一些问题”,而不是无声失败或中断对话。
- 更长的智能体工作流上下文:我们将上下文窗口从 32K 增加到 128K,以支持更长、更连贯的会话以及更复杂的任务流程。
- 更强的领域理解能力:模型能更好地保留专业术语、专有名词、医疗术语以及其他在生产环境中至关重要的词汇。
- 更可控的语气与表达方式:模型能更好地调整语气——在解决问题时保持冷静,在用户感到沮丧时展现同理心,或在确认操作成功时显得积极振奋。
- 可调节的推理努力程度:开发者现在可以从最低、低、中、高和极高五个推理级别中选择,默认级别为低,从而在简单交互的低延迟需求与复杂请求的审慎推理之间取得平衡。
这些提升体现在与生产环境语音智能体高度相关的音频评估中:在音频智能评测中,GPT-Realtime-2(高)在 Big Bench Audio 上的得分比 GPT-Realtime-1.5 高出 15.2%;在指令遵循方面,GPT-Realtime-2(极高)在 Audio MultiChallenge 上的得分比 GPT-Realtime-1.5 高出 13.8%,展现出更强的推理能力、上下文管理能力以及在实时对话中的控制力。
Big Bench Audio 评估了支持音频输入的语言模型在复杂推理能力方面的表现。Audio MultiChallenge 则评估了语音对话系统中的多轮对话智能,包括指令遵循、上下文整合、自我一致性以及处理自然语音修正的能力。
GPT-Realtime-2 的魔力在多种不同的应用场景中得以展现:
我正在考虑在通勤铁路站旁开一家 900 平方英尺的独立咖啡店。周二至周四早上 7 点到 10 点是客流量高峰;周一、周五以及下午时段客流则少得多。租金很贵,但我很喜欢舒适座位、慢冲手冲咖啡和本地糕点的理念。请为我做一个战略性的预先剖析:如果这家店一年后失败了,最可能的原因是什么?然后,在我投入全部精力开这家咖啡馆之前,建议一个我应该先测试的最小业务版本。
GPT-Realtime-2
让我们来压力测试一下这个想法,然后勾勒出你能运行的最小可行试点方案。如果一年后失败了,最可能的情况是经济账从未与需求节奏相匹配。你有一份昂贵的租约,以及一个为悠闲、慢饮和舒适座位而优化的概念,但你最强的客流想要的是在短暂的早晨时段里快速、可靠的咖啡。慢冲手冲咖啡和大量座位会拖慢出品速度和翻台率,而客流稀少的周一、周五和下午时段,你却在为无法盈利的空间支付租金。再加上人力成本、宽泛菜单带来的浪费,以及建立足够非高峰业务的挑战,现金流就会悄然断裂。要测试的最小版本是一个仅限高峰时段、菜单极简的配置。想象一下,在车站附近的一个推车、售货亭或共享柜台,只在周二至周四早上 7 点到 10 点营业。提供批量冲泡咖啡,如果可行的话,再加一种简单的浓缩咖啡选项,以及几款来自本地合作方的糕点。在你决定投入全部精力开一家完整的咖啡馆之前,先用它来衡量速度、回头客和定价能力。
GPT-Realtime-1.5
如果这家店一年后倒闭了,可能的原因包括:高估了早高峰通勤人群愿意逗留的意愿,在客流较少的时段未能产生足够收入,以及租金和人力带来的高固定成本无法被销售额抵消。也许这个概念未能引起那些即买即走的通勤者的共鸣,或者下午时段生意始终没有起色,导致你只能勉强维持微薄利润。你可能在营销上遇到了困难,或者没有根据客流量的起伏调整产品供应,从而引发了现金流问题。要小规模测试这个概念,你可以在早高峰时段在车站附近先开设一个快闪咖啡车或售货亭,提供你的招牌手冲咖啡和糕点。这能让你评估需求、优化菜单、培养本地回头客,并测试定价,而无需承担大额租约。一旦你看到稳定的销售额并了解了顾客行为,就能更有信心地规划更大的店面。
在早期测试中,企业使用 GPT‑Realtime-2 构建了语音智能体,通过自然对话帮助客户和员工完成任务:
“GPT-Realtime-2 的突出之处在于,它为复杂的语音交互带来了智能性和工具调用可靠性。在我们最难的对抗性基准测试中,经过提示词优化后,通话成功率提升了 26 个百分点(从 69% 提升至 95%)。GPT-Realtime-2 在公平住房合规方面也显著更加稳健,这对我们的业务至关重要。智能体能力与护栏强度的结合,正是使其在 Zillow 的生产级语音场景中可行的关键。”
—— Josh Weisberg,Zillow 高级副总裁兼人工智能负责人
实时翻译:构建实时多语言语音体验
GPT‑Realtime‑Translate 帮助开发者构建实时多语言语音体验,让每个人都能用自己偏好的语言说话,并实时听到翻译后的对话内容,同时还能阅读实时转录文本。它支持超过 70 种输入语言和 13 种输出语言,适用于客户支持、跨境销售、教育、活动、媒体以及服务全球受众的创作者平台。
对于开发者而言,实时翻译需要在保持语义的同时跟上说话者的语速,即使人们语速自然、切换语境或使用地域发音和领域特定语言也是如此。例如,德国电信正在测试该模型用于多语言语音交互,更低的延迟和更强的流畅度能让跨语言对话感觉更自然。
在这段视频中,Vimeo 展示了 GPT‑Realtime‑Translate 如何在产品教育视频播放时进行实时翻译,让全球客户无需等待单独制作的版本,就能用自己偏好的语言听到最新内容。
“为印度构建语音 AI 意味着要处理多样化的地域语音。在我们对印地语、泰米尔语和泰卢固语的评估中,GPT-Realtime-Translate 的词错误率比我们测试的任何其他模型都低 12.5%,同时回退率更低、任务完成度更高,且延迟能维持自然对话。它为多语言语音 AI 树立了新标准。”
——Prateek Sachan,BolnaAI 联合创始人兼首席技术官
实时转录:构建低延迟转录体验
GPT‑Realtime‑Whisper 是一种全新的流式转录模型,专为低延迟语音转文字而构建。它能在人们说话的同时转录音频,让实时产品感觉更快、响应更灵敏、更自然——从即时出现的字幕,到紧跟对话节奏的会议记录,皆是如此。
该模型使实时语音能够在业务工作流中即时发挥作用。团队可以为会议、课堂、广播和活动提供字幕;在对话进行中生成笔记和摘要;构建需要持续理解用户的语音智能体;并为客户支持、医疗、销售、招聘及其他高频率口语交互场景创建更快速的后续工作流。
安全性
Realtime API 集成了多层安全防护和缓解措施,以帮助防止滥用。我们对 Realtime API 会话采用主动分类器,这意味着如果检测到某些对话违反我们的有害内容准则,可以将其终止。开发者还可以使用 Agents SDK 轻松添加自己的额外安全护栏。
我们的使用政策禁止将我们服务的输出重新用于垃圾邮件、欺骗或其他有害目的。开发者还必须明确告知终端用户他们正在与 AI 交互,除非从上下文中已经显而易见。
Realtime API 完全支持面向欧盟应用的欧盟数据驻留,并受我们的企业隐私承诺保护。
定价与可用性
GPT‑Realtime‑2、GPT‑Realtime‑Translate 和 GPT‑Realtime‑Whisper 已在 Realtime API 中提供。GPT‑Realtime‑2 的定价为每 100 万音频输入 token 32 美元(缓存输入 token 为 0.40 美元),每 100 万音频输出 token 64 美元。GPT‑Realtime‑Translate 的定价为每分钟 0.034 美元。GPT‑Realtime‑Whisper 的定价为每分钟 0.017 美元。
您可以在 Playground 中测试新的实时语音模型。
要开始构建,请在 Codex 中打开此提示,将 GPT‑Realtime‑2 添加到现有应用或创建一个新应用。如果您还没有 Codex,请先下载 Codex 应用。
- 2026
- API 平台