# GPT-Live

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：logickkk1
- 发布时间：2026-07-10 05:46
- AIHOT 分数：87
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmre2mjao00npihwk0x95kbjf
- 原文链接：https://openai.com/index/introducing-gpt-live

## 精选理由

GPT‑Live 的全双工架构让 AI 语音首次能同时听和说，打断、沉默都变得自然，语音交互从轮流问答变成真正对话，这可能是一个转折点。

## AI 摘要

OpenAI推出GPT‑Live，全双工语音架构，能同时听与说，实时决策是否说话、倾听、暂停或中断。对需要搜索或推理的任务，委托后台GPT‑5.5等模型保持对话连贯。今日起向全球ChatGPT用户推出GPT‑Live‑1和GPT‑Live‑1 mini两个版本，未来将开放API。GPT‑Live‑1在GPQA、BrowseComp及τ³-Voice Telecom等评测上显著优于Advanced Voice Mode。每周超1.5亿人使用ChatGPT语音功能。

## 正文

新一代用于自然人机交互的语音模型，现已为 ChatGPT 语音功能提供支持。

我们正在推出 GPT‑Live，这是一代全新的语音模型，能让与 AI 的对话感觉更像真实的交流。

GPT‑Live 基于全双工架构构建，这意味着它可以同时进行听和说。在对话过程中，GPT‑Live 可以通过“嗯哼”或“对”这样的回应来表明它在认真倾听，能够进行快速的来回交流，或者在你需要思考片刻时保持安静。最终带来的是一种令人耳目一新、易于交谈的语音体验。

GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网络搜索、更深层次推理或更复杂工作的问题，它会在后台委托给我们的最新前沿模型，并在准备好后将结果带回对话中。在后台模型工作时，GPT‑Live 可以继续与你交谈并保持对话的流畅性。上线之初，GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型，我们将持续更新 GPT‑Live 所使用的模型。

这些进步为全新的 ChatGPT 语音体验提供了动力，使其使用起来更加智能和自然。随着时间的推移，我们相信这项研究还将解锁使用语音进行日益复杂、持续时间更长且更具智能体特性的工作的能力。

我们从今天开始向全球的 ChatGPT 用户逐步推出两个版本的 GPT‑Live——GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划很快将它们引入 API，开发者和企业可以通过此表单注册以接收通知。

进入人机交互的新时代

我们的愿景是实现真正自然的人机交互：一个与 AI 协作感觉就像与另一个人合作一样流畅和响应迅速的世界，同时推理和复杂任务的执行在后台无缝进行。

以往的方法

旧一代的语音 AI 系统让我们更接近这一愿景，但伴随着重要的权衡取舍。

级联式语音系统

级联语音系统依赖一系列模型依次运作，以处理每一轮对话。最初的 ChatGPT 语音功能将三个模型串联在一起：一个语音转文本模型用于转录你的语音，一个大语言模型用于生成回复，以及一个文本转语音模型用于将回复转换回语音。这种方法使我们首次能够与前沿 AI 模型对话，但这种复杂性也带来了代价：信息可能在模型间丢失，且响应速度慢、生硬不自然。

轮次式语音模型

像 ChatGPT 高级语音模式这样的轮次式语音模型，在单个模型内部处理和生成音频，降低了延迟，使对话更流畅——但它们仍然通过离散的轮次来运作。模型必须等待用户停止说话后才能回应，导致对话变得僵硬的你来我往。此外，由于轮次检测基于静默，即使是短暂的停顿或背景噪音也可能被误判为轮次结束——导致模型在不自然的时间点打断对话。

ChatGPT 高级语音模式对话示例

我们的新方法

GPT‑Live 通过两项架构变革解决了这些限制。

持续交互

首先，我们构建了 GPT‑Live，采用全双工架构实现持续交互。GPT‑Live 并非处理一系列独立的消息，而是在生成输出的同时持续处理输入。因此，模型可以每秒多次做出交互决策：是说话、继续聆听、暂停、打断，还是调用工具。

这使得模型能够进行更自然的来回对话，保持更好的时间感，甚至还能进行实时翻译。

委派以进行深度工作

其次，我们将负责持续交互的 GPT‑Live 与深度工作解耦。当某个问题需要搜索、推理或更强的智能体能力时，GPT‑Live 可以将任务委派给另一个模型（如 GPT‑5.5）。这使得它即使在后台处理多个任务时，也能保持对话继续进行。

这一架构变化还使得 GPT‑Live 能够持续使用最新的模型和智能体，将前沿智能与自然交互融为一体。

评估

我们构建了全新的人工评估体系，用于衡量对话的愉悦度和流畅性。在这些一对一对比测试中，在时长匹配的 5-10 分钟对话里，GPT‑Live‑1 和 GPT‑Live‑1 mini 在整体偏好、话轮转换、打断、对话流畅度以及每次交互的自然程度等指标上，均显著优于高级语音模式。

GPQA：GPT‑Live‑1 在 GPQA 上大幅超越高级语音模式，该基准测试考察生物学、化学和物理学领域的专家级科学推理能力。BrowseComp：GPT‑Live‑1 在 BrowseComp 上相比高级语音模式有显著提升，该基准测试考察智能体网络搜索和查找难以定位信息的能力。τ³-Voice Telecom（内部变体）：GPT‑Live‑1 在 τ³-Voice Telecom 上优于高级语音模式，该测试考察语音智能体在真实的多轮电信支持任务中的表现。

GPT‑Live‑1（instant）和 GPT‑Live‑1 mini 在后台使用 GPT‑5.5 Instant 模型，而 GPT‑Live‑1 Medium 和 GPT‑Live‑1 High 则使用 GPT‑5.5 Thinking 模型，并分别采用中等和高推理强度。

我们在此次评估中使用了一个定制化的用户模型，该模型由我们最新的推理模型驱动。

全新的 ChatGPT 语音体验

每周，超过 1.5 亿人使用语音和听写等功能与 ChatGPT 对话。他们用它来获取免提的日常帮助、练习语言、讲睡前故事，或是在通勤途中聊天。

从今天开始，当你点击语音按钮与 ChatGPT 对话时，你将获得由 GPT‑Live 驱动的改进体验——对话更自然、回答更智能、倾听更准确，并支持视觉回应。

更自然的对话

与 ChatGPT 对话现在应该感觉更像真正的交谈了。你可以用问题打断它，暂停下来整理思绪，或者让 ChatGPT 放慢语速。它会自然地用“嗯哼”或“明白了”这样的短语来回应你，让你知道它在跟上你的节奏。我们还为 GPT‑Live 重新制作了 ChatGPT 中的九种不同声音。

更智能的回答

ChatGPT 语音现在可以调用我们最新的前沿模型，在你需要时给出更智能的回答。你还可以选择适合自己需求的推理级别：即时模式用于快速响应，中等模式或高模式则在你希望 ChatGPT 花更多时间思考时使用。

更好的聆听

如果你需要片刻思考，ChatGPT 语音现在会等待，而不是抢着打断你。如果你让它保持安静并倾听，它就会照做。当有背景噪音时，比如过往的车流或附近的谈话声，ChatGPT 能更好地专注于你的声音，而不是被干扰。

一目了然的视觉答案

有些答案在你能够看到时会更有用。在你说话的同时，ChatGPT 现在可以针对天气、股票、体育等话题显示丰富的视觉卡片。语音功能也继续支持搜索、记忆、图片和文件上传。

最终呈现出的 ChatGPT 语音体验，在日常生活中感觉更自然、能力更强、也更有用。

为语音设计的安全保障

GPT‑Live 在设计上默认就是安全的。它建立在我们最新模型的安全进展之上，同时在关键风险领域增加了专门的安全训练，并针对语音场景设计了新的防护措施。

扩展的安全测试

为了更好地反映人们在真实场景中如何使用语音，我们首先扩展了安全测试，加入了新的原生音频评估。我们还创建了合成评估，利用生成的音频更集中地针对关键安全领域进行测试，这些经验来自高级语音模式。这些领域包括：自残、精神病与躁狂、对 AI 的情感依赖、暴力以及色情内容。内部专家还对模型进行了针对语音特有风险的红队测试。

在我们的测试中，GPT-Live 在我们评估的几乎所有领域，其表现都与高级语音模式相当或更优。您可以在 GPT-Live 系统卡中阅读更多关于我们测试和安全保障的信息。

内置安全保障

由于语音对话是实时进行的，我们还构建了能够在模型说话时采取行动的安全保障措施。当系统检测到潜在的不安全输出时，它可以引导模型给出更安全的回应，显示额外的安全信息或资源，或者在风险较高的情况下结束语音对话。对于涉及自残的对话，我们调整了 ChatGPT 的语音支持流程，包括提供经过专家验证的危机热线支持。

我们设计了额外的保护措施来支持青少年用户，并直接将适龄行为训练到模型中，以降低不当回应的风险。家长可以通过家长控制功能选择是否允许其青少年子女使用 ChatGPT 语音，并且在涉及潜在自残或自杀意图迹象的高风险情况下，关联的家长可能会收到通知。

从实际使用中学习

我们还在推出侧重于情感依赖的长期测量和发布后监控，以持续改进我们的理解并完善安全保障措施。基于我们先前在情感使用和情绪健康方面的研究，这将帮助我们识别新出现的模式，并改进系统在情感敏感互动中的回应方式。

最后，GPT-Live 是为对话而非语音模仿而设计的。它使用 ChatGPT 中一组预定义的语音，并设有防护措施以防止其模仿真实人物的声音。

我们致力于支持安全与福祉，并将随着从实际使用中学习而不断加强这些保护措施。

可用性与限制

GPT-Live 现正面向全球 ChatGPT 用户，在 iOS、Android 和 ChatGPT.com 上推出。GPT-Live-1 将成为 Go、Plus 和 Pro 用户 ChatGPT 语音功能的默认模型，而 GPT-Live-1 mini 将成为免费用户的默认模型。更多可用性详情可在我们的帮助中心找到。

我们已针对 ChatGPT 中最常用的一些语言优化了 GPT‑Live。对于某些语言，模型可能存在非母语口音或流利度不足的问题。我们正在积极努力改善跨语言的使用体验。

在发布之初，GPT‑Live 将不支持 ChatGPT 中的视频语音或屏幕共享功能，但我们正在努力尽快引入这些能力。您仍可访问旧版 ChatGPT 语音功能，包括标准语音模式和高级语音模式，这些功能中支持上述特性。

ChatGPT 现已成为您最具雄心工作的合作伙伴 产品 2026年7月9日

GPT-5.6：与您雄心同步扩展的前沿智能 产品 2026年7月9日
