# 通过 API 中的新模型推进语音智能

- 来源：OpenAI：官网动态（RSS · 排除企业/客户案例）
- 发布时间：2026-05-07 18:00
- AIHOT 分数：86
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmovr364j00j9slotqnozmpjp
- 原文链接：https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api

## 精选理由

语音模型不再只是‘听写’，开始能推理和翻译了，OpenAI这次API更新的几个新模型把语音智能推向更实用的阶段，做语音产品的值得赶紧试试。

## AI 摘要

OpenAI API 推出了新的实时语音模型，能够进行推理、翻译和语音转录。这些模型显著提升了语音交互的自然度与智能水平，支持实时处理与多语言转换。新功能旨在为开发者提供更强大的工具，以构建更流畅、更智能的语音应用体验。

## 正文

新一代实时语音模型，能够在人们说话时进行推理、翻译和转写。

我们在 API 中推出了三款音频模型，为开发者解锁了一类全新的语音应用。借助这些模型，开发者可以构建更自然、响应更智能、并能实时采取行动的语音体验：

GPT-Realtime-2，这是我们首款具备 GPT-5 级别推理能力的语音模型，能够处理更复杂的请求，并自然地推进对话。

GPT-Realtime-Translate，一款全新的实时翻译模型，可将 70 多种输入语言的语音翻译成 13 种输出语言，且与说话者保持同步。

GPT-Realtime-Whisper，一款全新的流式语音转文本模型，可在说话者讲话时实时转写语音。

试用 GPT-Realtime-2

开始会话，然后与 GPT-Realtime-2 自然对话。

开始会话

我可以问些什么？

开始会话后，可以尝试说出以下其中一项：

我今晚要临时办一场晚宴。我只有 30 分钟，两位素食朋友，一位不吃蘑菇，还有一个很小的厨房。帮我计划一个简单的菜单。

我正在日本迎接一场现场活动的来宾。用日语说一段温暖自然的欢迎词——就像主持人开启一场特别活动那样。

我的订单号是 Orbit-742Q。请清晰地复述一遍，以便我确认无误。

帮我练习如何告诉团队我们达成了发布里程碑。先用沉稳自信的语气说，再用更兴奋的语气说一遍。

我正在为一次公路旅行策划问答游戏。给我三个听起来出奇简单但容易上当的陷阱题，然后用一句话解释每个答案。

此演示有时限。使用即表示您同意 OpenAI 的条款并确认我们的隐私政策。

语音正成为人们使用软件最自然的方式之一。它让人可以在开车时寻求帮助、在穿过机场时更改旅行计划、用自己偏好的语言获得支持，或者无需停下来打字就能完成一项任务。

但构建有用的语音产品，需要的不仅仅是快速的对话轮换或听起来自然的语音。一个语音智能体需要理解说话人的意图、跟踪上下文、在请求发生变化时进行恢复、在对话持续进行的同时使用工具，并以一种贴合当下情境的方式做出回应。

我们推出的这些模型共同将实时音频从简单的问答模式，转变为能够真正执行任务的语音界面：在对话展开的过程中进行倾听、推理、翻译、转录和采取行动。

语音作为人与产品之间的交互界面

随着语音成为使用软件的一种更自然的方式，我们看到开发者正围绕语音 AI 中的三种新兴模式进行构建：

**语音到行动**，即人们可以描述自己的需求，系统能够推理该请求、使用工具并完成任务。例如，Zillow 正在构建一个助手，它可以倾听、推理并对诸如“在我的购房能力范围内找房子，避开繁忙街道，并安排周六看房”这样的请求采取行动。

**系统到语音**，即软件可以将上下文转化为实时的语音指导。例如，一个旅行应用可以主动告诉旅行者：“您的进港航班延误了，但您仍然可以赶上转机。我找到了新的登机口，规划了穿过航站楼的最快路线，并且您的行李预计仍能顺利转运。”

**语音到语音**，即 AI 可以帮助实时对话跨越语言、任务或不断变化的上下文持续进行。例如，Deutsche Telekom 正在构建语音支持体验，客户可以使用他们最熟悉的语言说话，而模型则实时翻译对话。

这些模式也可以协同工作。Priceline 正致力于实现这样一个未来：旅行者可以通过语音管理整个行程——以对话方式搜索航班和酒店，处理诸如航班延误后调整酒店预订等变更，获取 TSA 安检等待时间的实时更新，并在旅行者落地后进行对话翻译。

实时语音：帮助语音模型进行推理和采取行动

GPT-Realtime-2 专为实时语音交互而构建，模型在处理请求、调用工具、应对纠正或打断时，能保持对话流畅推进，并以贴合当下情境的方式做出回应。

前导语：开发者可以启用主回复前的简短语句，例如“让我查一下”或“请稍等，我查查看”，让用户知道智能体正在处理请求。

并行工具调用与工具透明度：模型可以同时调用多个工具，并通过“正在查看你的日历”或“正在查询”等语句让这些操作可闻，帮助智能体在完成任务的同时保持响应性。

更强的恢复行为：模型能以更优雅的方式恢复对话，例如说出“我现在遇到了一些问题”，而不是无声失败或中断对话。

更长的智能体工作流上下文：我们将上下文窗口从 32K 增加到 128K，以支持更长、更连贯的会话以及更复杂的任务流程。

更强的领域理解能力：模型能更好地保留专业术语、专有名词、医疗术语以及其他在生产环境中至关重要的词汇。

更可控的语气与表达方式：模型能更好地调整语气——在解决问题时保持冷静，在用户感到沮丧时展现同理心，或在确认操作成功时显得积极振奋。

可调节的推理努力程度：开发者现在可以从最低、低、中、高和极高五个推理级别中选择，默认级别为低，从而在简单交互的低延迟需求与复杂请求的审慎推理之间取得平衡。

这些提升体现在与生产环境语音智能体高度相关的音频评估中：在音频智能评测中，GPT-Realtime-2（高）在 Big Bench Audio 上的得分比 GPT-Realtime-1.5 高出 15.2%；在指令遵循方面，GPT-Realtime-2（极高）在 Audio MultiChallenge 上的得分比 GPT-Realtime-1.5 高出 13.8%，展现出更强的推理能力、上下文管理能力以及在实时对话中的控制力。

Big Bench Audio 评估了支持音频输入的语言模型在复杂推理能力方面的表现。Audio MultiChallenge 则评估了语音对话系统中的多轮对话智能，包括指令遵循、上下文整合、自我一致性以及处理自然语音修正的能力。

GPT-Realtime-2 的魔力在多种不同的应用场景中得以展现：

我正在考虑在通勤铁路站旁开一家 900 平方英尺的独立咖啡店。周二至周四早上 7 点到 10 点是客流量高峰；周一、周五以及下午时段客流则少得多。租金很贵，但我很喜欢舒适座位、慢冲手冲咖啡和本地糕点的理念。请为我做一个战略性的预先剖析：如果这家店一年后失败了，最可能的原因是什么？然后，在我投入全部精力开这家咖啡馆之前，建议一个我应该先测试的最小业务版本。

GPT-Realtime-2

让我们来压力测试一下这个想法，然后勾勒出你能运行的最小可行试点方案。如果一年后失败了，最可能的情况是经济账从未与需求节奏相匹配。你有一份昂贵的租约，以及一个为悠闲、慢饮和舒适座位而优化的概念，但你最强的客流想要的是在短暂的早晨时段里快速、可靠的咖啡。慢冲手冲咖啡和大量座位会拖慢出品速度和翻台率，而客流稀少的周一、周五和下午时段，你却在为无法盈利的空间支付租金。再加上人力成本、宽泛菜单带来的浪费，以及建立足够非高峰业务的挑战，现金流就会悄然断裂。要测试的最小版本是一个仅限高峰时段、菜单极简的配置。想象一下，在车站附近的一个推车、售货亭或共享柜台，只在周二至周四早上 7 点到 10 点营业。提供批量冲泡咖啡，如果可行的话，再加一种简单的浓缩咖啡选项，以及几款来自本地合作方的糕点。在你决定投入全部精力开一家完整的咖啡馆之前，先用它来衡量速度、回头客和定价能力。

GPT-Realtime-1.5

如果这家店一年后倒闭了，可能的原因包括：高估了早高峰通勤人群愿意逗留的意愿，在客流较少的时段未能产生足够收入，以及租金和人力带来的高固定成本无法被销售额抵消。也许这个概念未能引起那些即买即走的通勤者的共鸣，或者下午时段生意始终没有起色，导致你只能勉强维持微薄利润。你可能在营销上遇到了困难，或者没有根据客流量的起伏调整产品供应，从而引发了现金流问题。要小规模测试这个概念，你可以在早高峰时段在车站附近先开设一个快闪咖啡车或售货亭，提供你的招牌手冲咖啡和糕点。这能让你评估需求、优化菜单、培养本地回头客，并测试定价，而无需承担大额租约。一旦你看到稳定的销售额并了解了顾客行为，就能更有信心地规划更大的店面。

在早期测试中，企业使用 GPT‑Realtime-2 构建了语音智能体，通过自然对话帮助客户和员工完成任务：

“GPT-Realtime-2 的突出之处在于，它为复杂的语音交互带来了智能性和工具调用可靠性。在我们最难的对抗性基准测试中，经过提示词优化后，通话成功率提升了 26 个百分点（从 69% 提升至 95%）。GPT-Realtime-2 在公平住房合规方面也显著更加稳健，这对我们的业务至关重要。智能体能力与护栏强度的结合，正是使其在 Zillow 的生产级语音场景中可行的关键。”

—— Josh Weisberg，Zillow 高级副总裁兼人工智能负责人

实时翻译：构建实时多语言语音体验

GPT‑Realtime‑Translate 帮助开发者构建实时多语言语音体验，让每个人都能用自己偏好的语言说话，并实时听到翻译后的对话内容，同时还能阅读实时转录文本。它支持超过 70 种输入语言和 13 种输出语言，适用于客户支持、跨境销售、教育、活动、媒体以及服务全球受众的创作者平台。

对于开发者而言，实时翻译需要在保持语义的同时跟上说话者的语速，即使人们语速自然、切换语境或使用地域发音和领域特定语言也是如此。例如，德国电信正在测试该模型用于多语言语音交互，更低的延迟和更强的流畅度能让跨语言对话感觉更自然。

在这段视频中，Vimeo 展示了 GPT‑Realtime‑Translate 如何在产品教育视频播放时进行实时翻译，让全球客户无需等待单独制作的版本，就能用自己偏好的语言听到最新内容。

“为印度构建语音 AI 意味着要处理多样化的地域语音。在我们对印地语、泰米尔语和泰卢固语的评估中，GPT-Realtime-Translate 的词错误率比我们测试的任何其他模型都低 12.5%，同时回退率更低、任务完成度更高，且延迟能维持自然对话。它为多语言语音 AI 树立了新标准。”

——Prateek Sachan，BolnaAI 联合创始人兼首席技术官

实时转录：构建低延迟转录体验

GPT‑Realtime‑Whisper 是一种全新的流式转录模型，专为低延迟语音转文字而构建。它能在人们说话的同时转录音频，让实时产品感觉更快、响应更灵敏、更自然——从即时出现的字幕，到紧跟对话节奏的会议记录，皆是如此。

该模型使实时语音能够在业务工作流中即时发挥作用。团队可以为会议、课堂、广播和活动提供字幕；在对话进行中生成笔记和摘要；构建需要持续理解用户的语音智能体；并为客户支持、医疗、销售、招聘及其他高频率口语交互场景创建更快速的后续工作流。

安全性

Realtime API 集成了多层安全防护和缓解措施，以帮助防止滥用。我们对 Realtime API 会话采用主动分类器，这意味着如果检测到某些对话违反我们的有害内容准则，可以将其终止。开发者还可以使用 Agents SDK 轻松添加自己的额外安全护栏。

我们的使用政策禁止将我们服务的输出重新用于垃圾邮件、欺骗或其他有害目的。开发者还必须明确告知终端用户他们正在与 AI 交互，除非从上下文中已经显而易见。

Realtime API 完全支持面向欧盟应用的欧盟数据驻留，并受我们的企业隐私承诺保护。

定价与可用性

GPT‑Realtime‑2、GPT‑Realtime‑Translate 和 GPT‑Realtime‑Whisper 已在 Realtime API 中提供。GPT‑Realtime‑2 的定价为每 100 万音频输入 token 32 美元（缓存输入 token 为 0.40 美元），每 100 万音频输出 token 64 美元。GPT‑Realtime‑Translate 的定价为每分钟 0.034 美元。GPT‑Realtime‑Whisper 的定价为每分钟 0.017 美元。

您可以在 Playground 中测试新的实时语音模型。

要开始构建，请在 Codex 中打开此提示，将 GPT‑Realtime‑2 添加到现有应用或创建一个新应用。如果您还没有 Codex，请先下载 Codex 应用。

2026

API 平台
