OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-07-08 08:00·46天前
AI 导读

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
77AI 编辑部评分,满分 100

OpenAI 发布 GPT-Live 新一代全双工语音模型

2026-07-08 08:00· 46天前
AI 导读

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

推荐理由

GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

正文 · AI 翻译

新一代语音模型,专为自然的人机交互而生,现已为 ChatGPT 语音功能提供支持。

我们正在推出 GPT‑Live,这是一代全新的语音模型,能让与 AI 的对话感觉更像是在进行一场真实的交流。

GPT‑Live 基于全双工架构构建,这意味着它可以同时进行听和说。在对话过程中,GPT‑Live 可以通过“嗯哼”或“对”这样的词语来表明它在认真倾听,能够进行快速的你来我往,或者在你需要思考片刻时保持安静。最终带来的是一种令人耳目一新、易于交流的语音体验。

GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网络搜索、更深层次推理或更复杂工作的问题,它会在后台委托给我们最新的前沿模型,并在准备好后将结果带回对话中。在模型处理期间,GPT‑Live 可以继续与你交谈并保持对话的流畅性。上线之初,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们将持续更新 GPT‑Live 所使用的模型。

这些进步为全新的 ChatGPT 语音体验提供了动力,使其更加智能、使用起来也更加自然。随着时间的推移,我们相信这项研究还将解锁语音在日益复杂、耗时更长且更具智能体特性的工作中的应用能力。

从今天开始,我们开始向全球的 ChatGPT 用户逐步推出两个版本的 GPT‑Live——GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划很快将其引入 API,开发者和企业可以通过此表格注册以接收通知。

进入人机交互的新时代

我们的愿景是实现真正自然的人机交互:一个与 AI 协作感觉就像与另一个人合作一样流畅和响应迅速的世界,同时推理和复杂任务的执行在后台无缝进行。

以往的方法

前几代的语音 AI 系统让我们更接近这一愿景,但伴随着重要的权衡取舍。

级联式语音系统

级联语音系统依赖一系列模型依次运作,以处理每一轮交互。最初的 ChatGPT 语音功能将三个模型串联在一起:一个语音转文本模型用于转录你的语音,一个大语言模型用于生成回复,以及一个文本转语音模型用于将回复转换回语音。这种方法使我们首次能够与前沿 AI 模型对话,但这种复杂性是有代价的:信息可能在模型间丢失,且回复缓慢而僵硬。

语音转文本

文本转语音

语音转文本

文本转语音

轮次式语音模型

像 ChatGPT 高级语音模式这样的轮次式语音模型,在单个模型内处理和生成音频,减少了延迟,使对话更流畅——但它们仍然通过离散的轮次运作。模型必须等待用户停止说话后才能回应,导致僵硬的来回交替。此外,由于轮次检测基于静默,即使是短暂的停顿或背景噪音也可能被误判为轮次结束——导致模型在不自然的时间点打断。

ChatGPT 高级语音模式对话示例

我们的新方法

GPT‑Live 通过两项架构变革解决了这些局限。

持续交互

首先,我们构建了 GPT‑Live 以实现持续交互,采用了全双工架构。GPT‑Live 并非处理一系列独立消息,而是在生成输出的同时持续处理输入。因此,模型可以每秒多次做出交互决策:是否说话、继续倾听、暂停、打断或调用工具。

这使得模型能够进行更自然的来回交流,保持更好的时间感,甚至执行实时翻译。

深度工作的委派

其次,我们将处理持续交互的 GPT‑Live 与深度工作解耦。当某个问题需要搜索、推理或更强的智能体能力时,GPT‑Live 可以将任务委派给另一个模型,如 GPT-5.5。这使得它能够在后台处理多个任务的同时,保持对话继续进行。

这一架构变化还让 GPT‑Live 能够持续使用最新模型和智能体,将前沿智能与自然交互融为一体。

评估

我们构建了全新的人工评估体系,用于衡量对话的愉悦度和流畅性。在这些一对一对比测试中,GPT‑Live‑1 和 GPT‑Live‑1 mini 在 5–10 分钟的匹配对话中,在整体偏好、话轮转换、打断、对话流畅度以及交互自然感等维度上,均显著优于高级语音模式。

  • GPQA:GPT‑Live‑1 在 GPQA 基准测试上大幅超越高级语音模式,该测试评估生物学、化学和物理学领域的专家级科学推理能力。

  • BrowseComp:GPT‑Live‑1 在 BrowseComp 基准测试上相比高级语音模式有显著提升,该测试评估智能体网络搜索以及查找难以定位信息的能力。

  • τ³-Voice Telecom(内部变体)**:GPT‑Live‑1 在 τ³-Voice Telecom 测试中优于高级语音模式,该测试评估语音智能体在真实的多轮电信支持任务中的表现。

  • GPT‑Live‑1(instant)和 GPT‑Live‑1 mini 在后台使用 GPT‑5.5 Instant 模型,而 GPT‑Live‑1 Medium 和 GPT‑Live‑1 High 则使用 GPT‑5.5 Thinking 模型,并分别采用中等和高推理努力程度。

** 本次评估中,我们使用了由最新推理模型驱动的定制化用户模型。

全新的 ChatGPT 语音体验

每周,超过 1.5 亿人使用语音和听写等功能与 ChatGPT 对话。他们用它来获取免提的日常帮助、练习语言、讲睡前故事,或是在通勤途中闲聊。

从今天起,当你点击语音按钮与 ChatGPT 对话时,将获得由 GPT‑Live 驱动的升级体验——对话更自然、回答更智能、倾听更精准,并支持视觉回应。

更自然的对话

与 ChatGPT 对话现在应该感觉更像真正的交谈了。你可以随时打断提问、暂停整理思绪,或请 ChatGPT 放慢语速。它会自然地用“嗯哼”或“明白了”这样的回应来确认你的话,让你知道它在认真倾听。我们还为 GPT‑Live 重新制作了 ChatGPT 中九种各具特色的语音。

更智能的回答

ChatGPT 语音现在可以调用我们最新的前沿模型,在你需要时给出更智能的回答。你还可以选择适合自己需求的推理层级:即时模式用于快速响应,中或高模式则在你希望 ChatGPT 花更多时间思考时使用。

更好的倾听

如果你需要片刻思考,ChatGPT 语音现在会耐心等待,而不会抢话打断。如果你要求它保持安静并倾听,它也会照做。当有背景噪音时,比如过往车辆或附近交谈,ChatGPT 能更好地聚焦你的声音,而不会被干扰分心。

一目了然的视觉答案

有些答案用眼睛看会更直观。在对话过程中,ChatGPT 现在可以针对天气、股票、体育等话题展示丰富的视觉卡片。语音功能也继续支持搜索、记忆、图片和文件上传。

最终呈现的 ChatGPT 语音体验,在日常使用中更加自然、更加强大、更加实用。

专为语音设计的安全保障

GPT‑Live 在设计之初就以安全为默认原则。它建立在我们最新模型的安全进展之上,同时针对关键风险领域增加了专门的安全训练,并加入了专为语音设计的新防护措施。

扩展的安全测试

为了更好地反映人们在真实场景中如何使用语音,我们首先扩展了安全测试,加入了全新的原生音频评估。我们还创建了合成评估,利用生成的音频更集中地针对关键安全领域进行测试,这些经验来自高级语音模式。这些领域包括自残、精神病与躁狂、对 AI 的情感依赖、暴力以及色情内容。内部专家还对模型进行了针对语音特有风险的红队测试。

在我们的测试中,GPT‑Live 在几乎所有评估维度上的表现都与高级语音模式相当或更优。您可以在 GPT‑Live 系统卡中了解更多关于我们的测试和安全保障措施的信息。

内置安全保障

由于语音对话是实时进行的,我们还构建了能够在模型说话时即时介入的安全保障措施。当系统检测到潜在的不安全输出时,它可以引导模型给出更安全的回应,显示额外的安全提示或资源,或在风险较高的情况下终止语音对话。对于涉及自残行为的对话,我们针对语音场景调整了 ChatGPT 的支持流程,包括提供经专家验证的危机热线支持。

我们设计了额外的保护措施来支持青少年用户,并直接在模型中训练了符合年龄特征的行为,以降低不当回应的风险。家长可以通过家长控制功能选择是否允许其青少年子女使用 ChatGPT 语音功能,并且在涉及潜在自残或自杀意图迹象的高风险情况下,关联的家长可能会收到通知。

从实际使用中学习

我们还在推出以情感依赖为重点的长期测量和发布后监控,以持续改进我们的理解并完善安全措施。基于我们先前在情感使用和情感健康方面的研究,这将帮助我们识别新出现的模式,并改进系统在情感敏感互动中的回应方式。

最后,GPT‑Live 是为对话而设计的,而非用于声音模仿。它使用 ChatGPT 中一组预定义的语音,并设有安全措施以防止其模仿真实人物的声音。

我们致力于支持安全与福祉,并将随着从实际使用中不断学习,持续加强这些保护措施。

可用性与限制

GPT‑Live 现已面向全球 ChatGPT 用户,在 iOS、Android 和 ChatGPT.com 平台上逐步推出。GPT‑Live‑1 将成为 Go、Plus 和 Pro 用户 ChatGPT 语音功能的默认模型,而 GPT‑Live‑1 mini 将成为免费用户的默认模型。更多可用性详情,请查阅我们的帮助中心。

我们已针对 ChatGPT 中最常用的几种语言对 GPT‑Live 进行了优化。对于某些语言,模型可能存在非母语口音或流利度不足的问题。我们正在积极努力,以提升跨语言的使用体验。

在发布之初,GPT‑Live 将不支持 ChatGPT 中的视频语音或屏幕共享功能,但我们正在努力尽快引入这些能力。您仍可访问 ChatGPT 语音的旧版本,包括标准语音模式和高级语音模式,这些功能在这些版本中是可用的。