GPT-5.6 树立了性价比新标杆
GPT-5.6 模型系列让前沿级智能体性能变得大幅更实惠,同时也在不断拓展可能性的边界。
在本指南中,我们展示了初创公司如何利用更智能的模型选择以及新的 API 控制功能(这些功能有助于推理连续性、多智能体编排和程序化工具调用),以极低的成本构建更快、能力更强的智能体。
更出色的开箱即用体验
自 GPT-5 以来,每一代模型都致力于用更少的 token 处理更长周期的任务。GPT-5.6 延续了这一趋势:更强的智能体性能、更低的成本,同时对底层框架的改动微乎其微。
Artificial Analysis 编程指数
成本
顶层成本效率的提升,叠加了在较低推理强度下准确率的提高。例如,在 Agents' Last Exam 基准上,当框架保持不变时,GPT-5.6 Sol 在“低”推理强度下的表现优于 GPT-5.5 在“高”推理强度下的表现。我们在生产测试中也看到了类似的成功案例,初创公司报告称,通过将推理强度从之前的默认值降低,他们在各种工作流程中实现了显著的成本改善。
“我们把 GPT-5.6 接入到我们的框架中,低推理强度就给出了我们最好的结果。它知道数据什么时候根本不存在,不会去追查无价值的线索,并且用更少的 token 就得出了正确答案。”
—— Izzy Miller,Hex 公司 AI 研究负责人
模型选择
从历史上看,升级到旗舰模型并使用最高可用推理强度,一直是长周期用例的最佳选择。这在很大程度上是因为这些模型在处理更长上下文和工具调用方面,明显优于成本优化型模型。随着 5.6 系列的推出,这一情况发生了变化:借助更多的测试时计算,Luna 和 Terra 通常可以达到与 GPT-5.4 和 5.5 相近的性能,同时成本却要低得多。
“Luna 以十八分之一的成本,保留了 GPT-5.5 98% 的提取准确率。这让我们的智能体能够以高质量进行文档理解,而其价格使得这一能力可以在更多工作流程中实际落地。”
—— Serhii Shchoholiev,Hypha 公司智能体工程负责人
“我们在 106 个最难的浏览器任务上运行了 Luna,它完成了其中 78% 的任务,成本约为 14 美元。当前 SOTA 模型完成了 80% 的任务,成本约为 235 美元。这种能力与成本的组合,对浏览器智能体来说非常惊人。”
—— Gregor Zunic,Browser Use 联合创始人
“Luna 现在是我们多个高吞吐量代码检索和决策建模工作负载的默认模型。在我们多智能体工程系统中的一个关键代码探索任务中,它将推理成本降低了 64%,响应时间缩短了 90%,并将 F1 分数提升了 5 个百分点。”
—— Animesh Koratana,PlayerZero 创始人兼首席执行官
- Hypha
- Browser Use
- PlayerZero
以 BrowseComp 中的任务为例:这是一个基于搜索的评测基准,用于测试模型搜索冷门事实的能力。三个月前,GPT‑5.5(Extra High)在该基准上得分为 84.36%,总成本为 33.27 美元。发布时,GPT‑5.6 Luna(Extra High)实现了基本相同的性能,得分为 84.04%,成本仅为 1.33 美元。此后我们又进一步降低了价格。请阅读我们最新的降价公告。
较小的 5.6 系列模型非常适合高吞吐量工作负载、对延迟敏感的交互,以及智能体工作流中的重复步骤。例如,如果你运营一家法律科技初创公司,需要在智能体分析之前解析手写备忘录,那么现在不必在整个用例中使用前沿模型,而是可以使用 Terra 或 Luna 进行信息提取,从而大幅节省成本。
演进 Responses API,构建更高效的智能体架构
除了让 GPT‑5.6 开箱即用性能更强之外,我们还为 Responses API 推出了新的原语,以解锁更多性能提升。我们通过三项互补的架构干预措施对 GPT‑5.6 进行了端到端训练,使智能体能够更高效地运行:
- 复用已完成的工作:通过允许推理在模型轮次之间持久化,并使用原生压缩来压缩长时间运行的对话,模型可以在更长的任务周期内保持工作连贯性,而不会混淆或需要重建先前的上下文。
- 在适当情况下进行并行分解:利用原生多智能体编排,可以在并行工作流中协调多个智能体,从而更快地完成复杂任务。
- 将确定性工作移入代码:使用程序化工具调用,在模型上下文窗口之外对工具输出进行过滤、聚合和编排,将模型 token 留给需要判断力的任务,从而降低成本、延迟和上下文腐化。
两者结合使用,效果差异可能非常显著。例如,在 ARC-AGI-3 上,GPT‑5.6 Sol 使用标准评测框架得分为 13.3%。而启用保留式推理和压缩后,得分跃升至 38.3%——同时使用的输出 token 大约减少了 6 倍。模型本身没有任何改动,但性能却提升了近三倍。你可以在此处阅读更多关于我们 ARC-AGI-3 评测框架调查的内容。
程序化工具调用
智能体工作流通常涉及两类工作:
- 需要判断力的任务
- 主要涉及移动、过滤和合并数据的工作
当智能体检索 100 份文件、按日期过滤并识别相关交易时,模型不应在其上下文窗口中对每一个中间结果进行推理。程序化工具调用让 GPT‑5.6 能够编写 JavaScript 来编排工具、并行运行独立调用,并在上下文窗口之外处理其输出。模型得以专注于真正需要智能的部分:运用判断力。
“对于金融研究而言,难点在于可靠地提取文件、协调工具并处理数据。在我们的评估中,使用程序化工具调用的 GPT‑5.6 在达到我们评分标准质量的同时,输入 token 使用量减少了 21%。这就是一个能讨论金融研究的智能体与一个能真正执行金融研究的智能体之间的区别。”
—— Alex Wang,Rogo 应用 AI 团队
多智能体
在复杂且可并行化的任务上,将行动和推理分散到多个智能体工作流中,既能加快任务完成速度,也能提升智能水平。在这些设置中,主智能体负责编排子智能体并向它们委派任务。子智能体并行推进各自的目标,最终将输出交回主智能体进行最终综合。团队可以通过在 Responses API 中启用 multi-agent 功能,原生地开始使用多智能体架构。ChatGPT 中的 ultra 能力设置也正是这样运作的。
“Qualia 在开放式研究问题上运行智能体团队,而 GPT‑5.6 Sol 一下子就契合了。它相比 GPT‑5.5 有显著提升,完成速度几乎快于我们测试的所有其他模型,很快就成了我们首选的 OpenAI 模型。”
—— E Chi,Quadrillion 创始人
“GPT‑5.6 是我们见过的 OpenAI 最好的编排者。我们一次性向它抛了六份规格说明(同时进行写作、构建和讨论),它全程跟踪所有内容,质量始终没有崩坏。”
—— Jon Bell,Obvious 联合创始人兼 CPO
“Qualia 在开放式研究问题上运行智能体团队,而 GPT‑5.6 Sol 一下子就契合了。它相比 GPT‑5.5 有显著提升,完成速度几乎快于我们测试的所有其他模型,很快就成了我们首选的 OpenAI 模型。”
—— E Chi,Quadrillion 创始人
“GPT‑5.6 是我们见过的 OpenAI 最好的编排者。我们一次性向它抛了六份规格说明(同时进行写作、构建和讨论),它全程跟踪所有内容,质量始终没有崩坏。”
—— Jon Bell,Obvious 联合创始人兼 CPO
- Quadrillion
- Obvious
尽管 GPT‑5.6 对合适的子智能体数量以及何时生成它们有很强的判断力,但多智能体行为是高度可引导的。通过指示模型何时调用子智能体,可以增加仅在额外 token 开销能带来更优性能的情况下才生成智能体的可能性。
提示词缓存
在整个模型系列中,提示词缓存 TTL 已延长至至少 30 分钟,并且现在可以在模型的上下文窗口内确定性地设置缓存断点。这使得初创公司能够显著提高其缓存命中率。
“我们向一个共享的 29,000 token 提示词中添加了缓存断点和工作区专属密钥,并将未缓存的输入减少了 28%。30 分钟的缓存窗口也是一个巨大的解锁:我们的智能体可以在多次运行中复用相同的上下文,而不是每次都从头开始。”
—— Lorenzo Gentile,Ploy 公司 AI 工程师
除了设置缓存断点之外,继续使用合适的 `prompt_cache_key` 也会增加请求命中与之前服务过相同前缀的同一推理引擎的概率,从而降低延迟。
结论
这些示例中突出的一点是,构建智能体的经济性已经发生了多大的变化。
曾经每一步都需要前沿模型的使用场景,现在可以通过使用较小的模型、调整推理力度以及做出高效的架构选择,以极低的成本获得相当甚至更好的结果。
我们非常期待看到大家构建的成果!
关于作者
本指南由 Samarth Madduru、Prashant Mital、Dave Leo 和 Julien Reiman 共同编写,基于他们与基于 GPT-5.6 构建的初创公司从早期测试到生产阶段的密切合作经验。