新一代用于自然人机交互的语音模型,现已为 ChatGPT 语音功能提供支持。
我们正在推出 GPT‑Live,这是一代全新的语音模型,能让与 AI 的对话感觉更像真实的交流。
GPT‑Live 基于全双工架构构建,这意味着它可以同时进行听和说。在对话过程中,GPT‑Live 可以通过“嗯哼”或“对”这样的回应来表明它在认真倾听,能够进行快速的来回交流,或者在你需要思考片刻时保持安静。最终带来的是一种令人耳目一新、易于交谈的语音体验。
GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网络搜索、更深层次推理或更复杂工作的问题,它会在后台委托给我们的最新前沿模型,并在准备好后将结果带回对话中。在后台模型工作时,GPT‑Live 可以继续与你交谈并保持对话的流畅性。上线之初,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们将持续更新 GPT‑Live 所使用的模型。
这些进步为全新的 ChatGPT 语音体验提供了动力,使其使用起来更加智能和自然。随着时间的推移,我们相信这项研究还将解锁使用语音进行日益复杂、持续时间更长且更具智能体特性的工作的能力。
我们从今天开始向全球的 ChatGPT 用户逐步推出两个版本的 GPT‑Live——GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划很快将它们引入 API,开发者和企业可以通过此表单注册以接收通知。
进入人机交互的新时代
我们的愿景是实现真正自然的人机交互:一个与 AI 协作感觉就像与另一个人合作一样流畅和响应迅速的世界,同时推理和复杂任务的执行在后台无缝进行。
以往的方法
旧一代的语音 AI 系统让我们更接近这一愿景,但伴随着重要的权衡取舍。
级联式语音系统
级联语音系统依赖一系列模型依次运作,以处理每一轮对话。最初的 ChatGPT 语音功能将三个模型串联在一起:一个语音转文本模型用于转录你的语音,一个大语言模型用于生成回复,以及一个文本转语音模型用于将回复转换回语音。这种方法使我们首次能够与前沿 AI 模型对话,但这种复杂性也带来了代价:信息可能在模型间丢失,且响应速度慢、生硬不自然。
轮次式语音模型
像 ChatGPT 高级语音模式这样的轮次式语音模型,在单个模型内部处理和生成音频,降低了延迟,使对话更流畅——但它们仍然通过离散的轮次来运作。模型必须等待用户停止说话后才能回应,导致对话变得僵硬的你来我往。此外,由于轮次检测基于静默,即使是短暂的停顿或背景噪音也可能被误判为轮次结束——导致模型在不自然的时间点打断对话。
ChatGPT 高级语音模式对话示例
我们的新方法
GPT‑Live 通过两项架构变革解决了这些限制。
持续交互
首先,我们构建了 GPT‑Live,采用全双工架构实现持续交互。GPT‑Live 并非处理一系列独立的消息,而是在生成输出的同时持续处理输入。因此,模型可以每秒多次做出交互决策:是说话、继续聆听、暂停、打断,还是调用工具。
这使得模型能够进行更自然的来回对话,保持更好的时间感,甚至还能进行实时翻译。
委派以进行深度工作
其次,我们将负责持续交互的 GPT‑Live 与深度工作解耦。当某个问题需要搜索、推理或更强的智能体能力时,GPT‑Live 可以将任务委派给另一个模型(如 GPT‑5.5)。这使得它即使在后台处理多个任务时,也能保持对话继续进行。
这一架构变化还使得 GPT‑Live 能够持续使用最新的模型和智能体,将前沿智能与自然交互融为一体。
评估
我们构建了全新的人工评估体系,用于衡量对话的愉悦度和流畅性。在这些一对一对比测试中,在时长匹配的 5-10 分钟对话里,GPT‑Live‑1 和 GPT‑Live‑1 mini 在整体偏好、话轮转换、打断、对话流畅度以及每次交互的自然程度等指标上,均显著优于高级语音模式。
GPQA:GPT‑Live‑1 在 GPQA 上大幅超越高级语音模式,该基准测试考察生物学、化学和物理学领域的专家级科学推理能力。BrowseComp:GPT‑Live‑1 在 BrowseComp 上相比高级语音模式有显著提升,该基准测试考察智能体网络搜索和查找难以定位信息的能力。τ³-Voice Telecom(内部变体):GPT‑Live‑1 在 τ³-Voice Telecom 上优于高级语音模式,该测试考察语音智能体在真实的多轮电信支持任务中的表现。
GPT‑Live‑1(instant)和 GPT‑Live‑1 mini 在后台使用 GPT‑5.5 Instant 模型,而 GPT‑Live‑1 Medium 和 GPT‑Live‑1 High 则使用 GPT‑5.5 Thinking 模型,并分别采用中等和高推理强度。
我们在此次评估中使用了一个定制化的用户模型,该模型由我们最新的推理模型驱动。
全新的 ChatGPT 语音体验
每周,超过 1.5 亿人使用语音和听写等功能与 ChatGPT 对话。他们用它来获取免提的日常帮助、练习语言、讲睡前故事,或是在通勤途中聊天。
从今天开始,当你点击语音按钮与 ChatGPT 对话时,你将获得由 GPT‑Live 驱动的改进体验——对话更自然、回答更智能、倾听更准确,并支持视觉回应。
更自然的对话
与 ChatGPT 对话现在应该感觉更像真正的交谈了。你可以用问题打断它,暂停下来整理思绪,或者让 ChatGPT 放慢语速。它会自然地用“嗯哼”或“明白了”这样的短语来回应你,让你知道它在跟上你的节奏。我们还为 GPT‑Live 重新制作了 ChatGPT 中的九种不同声音。
更智能的回答
ChatGPT 语音现在可以调用我们最新的前沿模型,在你需要时给出更智能的回答。你还可以选择适合自己需求的推理级别:即时模式用于快速响应,中等模式或高模式则在你希望 ChatGPT 花更多时间思考时使用。
更好的聆听
如果你需要片刻思考,ChatGPT 语音现在会等待,而不是抢着打断你。如果你让它保持安静并倾听,它就会照做。当有背景噪音时,比如过往的车流或附近的谈话声,ChatGPT 能更好地专注于你的声音,而不是被干扰。
一目了然的视觉答案
有些答案在你能够看到时会更有用。在你说话的同时,ChatGPT 现在可以针对天气、股票、体育等话题显示丰富的视觉卡片。语音功能也继续支持搜索、记忆、图片和文件上传。
最终呈现出的 ChatGPT 语音体验,在日常生活中感觉更自然、能力更强、也更有用。
为语音设计的安全保障
GPT‑Live 在设计上默认就是安全的。它建立在我们最新模型的安全进展之上,同时在关键风险领域增加了专门的安全训练,并针对语音场景设计了新的防护措施。
扩展的安全测试
为了更好地反映人们在真实场景中如何使用语音,我们首先扩展了安全测试,加入了新的原生音频评估。我们还创建了合成评估,利用生成的音频更集中地针对关键安全领域进行测试,这些经验来自高级语音模式。这些领域包括:自残、精神病与躁狂、对 AI 的情感依赖、暴力以及色情内容。内部专家还对模型进行了针对语音特有风险的红队测试。
在我们的测试中,GPT-Live 在我们评估的几乎所有领域,其表现都与高级语音模式相当或更优。您可以在 GPT-Live 系统卡中阅读更多关于我们测试和安全保障的信息。
内置安全保障
由于语音对话是实时进行的,我们还构建了能够在模型说话时采取行动的安全保障措施。当系统检测到潜在的不安全输出时,它可以引导模型给出更安全的回应,显示额外的安全信息或资源,或者在风险较高的情况下结束语音对话。对于涉及自残的对话,我们调整了 ChatGPT 的语音支持流程,包括提供经过专家验证的危机热线支持。
我们设计了额外的保护措施来支持青少年用户,并直接将适龄行为训练到模型中,以降低不当回应的风险。家长可以通过家长控制功能选择是否允许其青少年子女使用 ChatGPT 语音,并且在涉及潜在自残或自杀意图迹象的高风险情况下,关联的家长可能会收到通知。
从实际使用中学习
我们还在推出侧重于情感依赖的长期测量和发布后监控,以持续改进我们的理解并完善安全保障措施。基于我们先前在情感使用和情绪健康方面的研究,这将帮助我们识别新出现的模式,并改进系统在情感敏感互动中的回应方式。
最后,GPT-Live 是为对话而非语音模仿而设计的。它使用 ChatGPT 中一组预定义的语音,并设有防护措施以防止其模仿真实人物的声音。
我们致力于支持安全与福祉,并将随着从实际使用中学习而不断加强这些保护措施。
可用性与限制
GPT-Live 现正面向全球 ChatGPT 用户,在 iOS、Android 和 ChatGPT.com 上推出。GPT-Live-1 将成为 Go、Plus 和 Pro 用户 ChatGPT 语音功能的默认模型,而 GPT-Live-1 mini 将成为免费用户的默认模型。更多可用性详情可在我们的帮助中心找到。
我们已针对 ChatGPT 中最常用的一些语言优化了 GPT‑Live。对于某些语言,模型可能存在非母语口音或流利度不足的问题。我们正在积极努力改善跨语言的使用体验。
在发布之初,GPT‑Live 将不支持 ChatGPT 中的视频语音或屏幕共享功能,但我们正在努力尽快引入这些能力。您仍可访问旧版 ChatGPT 语音功能,包括标准语音模式和高级语音模式,这些功能中支持上述特性。
ChatGPT 现已成为您最具雄心工作的合作伙伴 产品 2026年7月9日
GPT-5.6:与您雄心同步扩展的前沿智能 产品 2026年7月9日