GPT-5.6 系列模型发布:Sol、Terra、Luna

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-07-09 18:00·49天前
AI 导读

OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
85AI 编辑部评分,满分 100

GPT-5.6 系列模型发布:Sol、Terra、Luna

2026-07-09 18:00· 49天前
AI 导读

OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

推荐理由

GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

正文 · AI 翻译

从每个模型 token 中获取更多智能,每美元获得更强性能,以及按需提供更多能力,助你攻克最艰巨的工作。

在有限预览之后,我们正式面向大众发布 GPT‑5.6 系列模型:我们的新旗舰 Sol,以及面向日常工作的均衡模型 Terra,还有我们最具成本效益的模型 Luna。

GPT‑5.6 Sol 在智能和效率两方面都树立了新标准,在编程、知识工作、网络安全和科学领域均取得了业界领先的成果,同时以更少的模型 token 和更低的预估成本超越了此前及同类的顶尖模型。其结果是更强的每美元性能:同样的花费能完成更多成功的工作,或者以更低的总成本获得可比的结果。我们还引入了一种加速最艰巨工作的新方式:ultra 是我们的最高能力设置,它协调多个智能体在并行工作流中协同作业,从而更快地完成复杂任务。更强的计算机使用能力和设计判断力使 GPT‑5.6 Sol 成为我们迄今为止最成熟的协作者,帮助它检查、优化并交付可直接使用的结果。

我们训练 GPT‑5.6 的目的是从每个模型 token 中获取更多有用的工作成果。在 Agents' Last Exam(一项横跨 55 个领域的长期专业工作流评估)中,GPT‑5.6 Sol 以 53.6 分创下新高,领先 Claude Fable 5(自适应推理)13.1 分。即使在中等推理水平下,它也比 Fable 5 高出 11.4 分,而预估成本仅为后者的约四分之一。这种效率也延伸到了更小的模型——这些模型对于让智能更丰富、更实惠至关重要:GPT‑5.6 Terra 和 GPT‑5.6 Luna 以约十六分之一的成本超越了 Fable 5。在 Artificial Analysis Intelligence Index(一项涵盖智能体工作、编程、科学推理和通用能力的广泛智能衡量指标)上,GPT‑5.6 Sol 在最大推理模式下与 Fable 5 的差距仅在一分之内,同时完成任务的时间缩短了 61%,预估成本约为后者的一半。

GPT‑5.6 推出了我们迄今为止最强大的安全防护措施,旨在抵御顽固且适应性强的滥用行为,同时不广泛限制合法用途。在正式发布前,我们对该模型及安全措施进行了迄今为止最广泛的评估,结合了人工红队测试和大规模自动化测试。在预览期间,我们与专家组织及受信任的合作伙伴密切合作,对防御机制进行压力测试,并在更广泛发布前强化了安全措施。最终形成的系统将模型内嵌的防护层与实时检查、监控以及根据信任和风险校准的访问权限相结合。

默认高效,按需实现极致性能

GPT‑5.6 Sol 是我们迄今为止最优秀的编程模型。在 Artificial Analysis 编程智能体指数中,启用最大推理能力的 GPT‑5.6 Sol 以 80 分创下新的行业最佳水平,比 Fable 5 高出 2.8 分,同时使用的输出 token 不到一半,耗时不到一半,成本降低约三分之一。这一优势延伸至整个系列:Terra 的表现略高于 Fable 5,而 Luna 则优于 Opus 4.8;每个模型完成任务的耗时约为三分之一,输出 token 约为一半,预估成本约为四分之一。该模型还在 Terminal‑Bench 2.1 和 DeepSWE 上创下了新的最佳成绩,这两项基准测试评估的是真实代码库中的复杂命令行工作流和长周期工程能力。

GPT‑5.6 能够编写并运行轻量级程序,用于协调工具、处理中间结果、监控进度,并在工作推进过程中选择下一步行动。这使得工具密集型任务能够以更少的 token、更少的模型往返次数和更少的指导来推进。开发者无需编写每一步脚本,也无需将每个工具响应都传回模型,Responses API 中的程序化工具调用功能即可过滤大量中间数据,仅保留关键信息,并在此过程中动态调整工作流程。

对于需要投入更多时间和算力才能获得更好回报的问题,GPT‑5.6 可以突破这一高效默认值。max 模式给予 GPT‑5.6 比 xhigh 模式更多的时间来进行推理、探索备选方案、执行检查并修正其方法。ultra 模式则更进一步,默认并行协调四个智能体,通过消耗更多模型 token 来换取更强结果,并在高难度任务上实现更快的响应时间。下图比较了 ultra 模式的默认四智能体配置与单智能体基线在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 上的表现;BrowseComp 和 SEC-Bench Pro 还展示了 16 智能体配置的结果。在所有三项评估中,增加并行智能体使评分-延迟曲线向左上方移动,从而在更短时间内取得更强结果。在 API 中,开发者可以使用 Responses API 中的多智能体测试版来构建类似 ultra 的体验。

“在我们对智能体代码审查测试的评估中,GPT‑5.6 是最强的模型。在我们内部和外部的同类 PR 基准测试中,它在 F1 分数上击败了 GPT‑5.5,同时每个 PR 消耗的模型 token 大约减少了 3 倍,中位延迟降低了约 2 倍。”

——Itamar Friedman,Qodo 联合创始人兼首席执行官

“GPT‑5.6 是金融研究智能体领域的一大进步。在 Rogo 的大金融基准测试中,与 GPT‑5.5 相比,它在评分标准质量上提升了 6.2 分,在答案准确率上提升了 3.6 分。通过程序化工具调用,它在保持质量的同时,输出模型 token 减少了 24%,任务完成速度提升了 28%。这种准确性、速度和效率的结合,正是我们规模化高质量金融分析所需要的。”

——Alex Wang,Rogo 应用人工智能部门

“在法律研究和文档工作流程中,GPT‑5.6 已经带来了足以改变产品经济效益的效率提升。在我们的综合评估套件中,它在法律研究和交易法用例中,使用模型 token 减少了 14%,同时质量得到提升。对于多步骤文档分析,程序化工具调用将提示词 token 削减了 38%,且质量无损。”

——Angel Faus,Clio 联合创始人兼首席技术官

“GPT‑5.6 Sol 真的非常出色。它是我们迄今为止见过的最坚韧的问题解决者,能够连续数天保持专注并持续完成任务。随着工作空间的演变,它在更新自定义智能体和优化记忆方面表现卓越,因此运行时间越长,它们就越敏锐。Terra 和 Luna 也远超其价格水平。许多运行 GPT‑5.5 的智能体在 Terra 上能以一半的成本和少 16% 的模型 token 达到同样出色的性能。”

—西蒙·拉斯特,Notion 联合创始人

“GPT‑5.6 给人的感觉不像一个聊天助手,而更像一个端到端的技术操作员。它可以检查实时系统、调试问题、修改代码、验证结果、发布工件,并在长时间会话中保持强大的上下文连贯性。”

—伊恩·特雷西,Ramp 公司应用 AI 软件工程师

“GPT‑5.6 在理解我想要的工作层次方面比前代产品好得多。在涉及研究、规划再到分阶段实施的跨阶段 Codex 工作流中,它比 GPT‑5.5 更能遵循我的意图,并且始终能生成准确的、带有行级链接的 GitHub 引用,而之前的模型常常会遗漏。”

—肖恩·莫兰,Shopify 高级应用 AI/ML 工程师

“GPT‑5.6 为我们带来了在复杂金融研究中所见过的最佳效率表现。在我们的评估中,它达到了顶级水平,同时 token 效率提升了 1.72 倍,在三个主要类别中领先,并在多跳任务上获得了 88% 的分数。效率、准确性和质量的结合,使该模型非常适合扩展金融研究工作流。”

—阿尔贝托·达科斯塔,Balyasny 资产管理公司应用 AI 首席工程师

“GPT‑5.6 在长时间运行的任务中始终能保持专注,出色地使用工具,并且几乎无需引导就能获得高质量的解决方案。对于研究和设计工作,它能生成清晰的报告和直观的图表,帮助我们的团队理解复杂系统并加快进度。”

—阿琼·桑巴穆尔蒂,思科 AI 软件与平台部门副总裁兼首席技术官

“GPT‑5.6 Sol 在推理、决策和自主性方面表现出显著改进。对子智能体使用的改进对于复杂的会计工作尤其有价值。对 OpenAI 智能体开发的方向感到兴奋。”

—Tarrek Shaban,Basis 产品负责人

设计领域的飞跃

GPT‑5.6 在设计判断力上实现了阶跃式提升。仅凭高层级方向指引,GPT‑5.6 就能打造出美观、符合人体工学且功能实用的界面。其更强的计算机使用能力使其能够检查并优化渲染后的结果——而不仅仅是生成底层代码或内容——从而在交付前发现视觉和功能问题,并完成最后的润色。

GPT‑5.6 的前端能力还能在 ChatGPT Work 中将自然语言请求转化为精美、可交互的解释和可视化内容。

端到端的知识工作

GPT‑5.6 在专业任务上能提供更优的结果。它能从你的文档以及 Slack、Notion、Microsoft 365 和 Google Drive 等日常工作中提取杂乱无章的上下文,并将其转化为专家级、可共享的成品。

GPT‑5.6 在知识工作方面的实力体现在涵盖长周期专业分析、浏览、工具使用和计算机使用等多项评估中。GPT‑5.6 Sol 在 BrowseComp 上取得了 92.2% 的最新最优结果,在 OSWorld 2.0 上达到 62.6%;在 OSWorld 上,它超越了 Opus 4.8,同时使用的输出 token 减少了 85%。在此,性能性价比的提升贯穿整个 GPT‑5.6 家族。Luna 以不到一半的预估成本,几乎达到了 GPT‑5.5 的峰值性能,而 Terra 则以更低的成本超越了它。

GPT‑5.6 Sol 提升了演示文稿、文档和电子表格的质量,生成的输出更加精良和准确。它可以从零开始创建完全可编辑的演示文稿,将提示词和源材料转化为连贯的视觉叙事,并具备出色的布局、层级和设计。

在遵循模板和参考演示文稿时,这种改进尤为显著。GPT‑5.6 能够推断演示文稿的设计体系——布局、排版、间距、颜色以及重复出现的内容模式,包括嵌入在幻灯片母版中的规则——并将这些规范一致地应用于新内容。在此示例中,当要求根据参考文件更新数字时,GPT‑5.5 的输出缺少母版幻灯片中的关键组件,而 GPT‑5.6 则更忠实地遵循了参考结构。

GPT‑5.6 还能创建视觉上更精致的文档和电子表格。它能更忠实地遵循复杂的引用格式,这对于可重复的知识工作活动非常重要。它能更精确地处理方程和金融模型,并能更好地运用排版、间距、层级以及页面或工作表布局。

Pinecrest Research Partners | Blossom Co. (BLSM) | 首次覆盖

请参阅本报告末尾的重要披露信息 1

股票研究 | 非必需消费-专业零售与数字商务 2026年7月8日

Pinecrest Research Partners LLC

Blossom Co. (纳斯达克: BLSM)

经常性业务组合与配送密度创造盈利拐点——首次覆盖,给予增持评级

评级:增持(首次覆盖)| 目标价 34.00 美元 | 上次收盘价(2026年7月7日)27.40 美元

目标价隐含上涨空间:+24.1%

市场数据

市值

24.7 亿美元

企业价值

23.1 亿美元

净现金 /(负债)

1.53 亿美元

稀释后流通股数

9000 万股

自由流通股

90天日均成交量

120 万股

52周价格区间

18.20 美元 - 31.60 美元

股息率

不适用(无股息)

过去12个月净资产收益率

财年截止日

12月31日

上市交易所 / 指数

纳斯达克 / 罗素2000指数

报告货币

美元

来源:Pinecrest Research Partners;收盘价序列截至2026年7月7日。罗素2000指数以2025年7月8日为基准日重设为100。

执行摘要

我们首次覆盖 Blossom Co.(“Blossom”或“BLSM”),给予增持评级,目标价34美元,

意味着较上次收盘价有约24%的上涨空间。Blossom 是一个技术驱动的优质鲜花、礼品

和订阅平台,结合了专有个性化技术、九个区域制备中心以及

约280家经过认证的本地工作室。我们认为 Blossom 正从一个以节日驱动的在线花店转型为

一个更高频次的礼品平台,其经常性会员和企业服务提升了收入

可见性、客户生命周期价值以及履约密度。

我们的投资论点基于三点:

•(1)收入质量正在改善。会员、订阅和企业平台收入

占2025财年销售额的35.8%;我们预计到2028财年,这一组合比例将达到44.3%。这些收入流具有

相比一次性购买,留存率更高、增量获客成本更低,且订单可见性更好。

同期付费订阅用户从115万增长至218万,

而企业礼品业务则受益于员工表彰计划、忠诚度积分整合以及不断扩展的履约API。

BLSM 12个月价格走势 vs 罗素2000指数

BLSM(价格,美元,左轴)

罗素2000指数(基准=100,右轴)

2025年7月 2025年9月 2025年11月 2026年1月 2026年3月 2026年5月 2026年7月

52周最高价 31.60美元

最新价 27.40美元

BLSM价格(美元)

罗素2000指数(基准=100)

早期测试GPT‑5.6的客户发现,其在各领域的知识工作输出均有提升。

“GPT‑5.6在处理构建生产级应用所需的长篇复杂工作流时效率显著。作为Lovable目前使用的模型之一,它相比之前的模型,大约减少了25%的步骤和35–48%的工具调用次数,同时将项目成功率提升了15%,并减少了卡住运行的次数。对于任何试图从创意走向可用应用的人来说,这都是一个意义重大的进步。”

——Fabian Hedin,Lovable联合创始人

“GPT‑5.6 Sol是我们评估过的第一个能够持续生成可直接用于实际工作的演示文稿的模型。在Model ML的FinBench中,针对20个具有挑战性的客户工作流和数百份演示文稿,它每份演示文稿使用的token比Fable少39%,同时生成的演示文稿更精致、更易读,数据可视化更清晰、更准确,在分享前所需的返工也更少。”

——Chaz Englander,ModelML联合创始人兼CEO

“GPT‑5.6是我们七项任务基准测试中整体表现最佳的前端模型。在我们五分制的前端质量评估标准中,它获得了4.4分,而GPT‑5.5为4.0分,Claude 4.8为3.5分,并且能够持续将复杂的电商、仪表盘和产品需求文档转化为在桌面端和移动端均完整且响应式的界面。”

——AJ Orbach,Triple Whale CEO

“借助GPT‑5.6的程序化工具调用功能,我们能够通过结构化API更高效地构建详细的Unity场景。在场景构建工作流中,与使用直接工具调用的同一模型相比,它总共减少了63.5%的token使用量和50.1%的模型交互次数,同时生成了可比的视觉效果。这使得迭代式游戏创作在规模化方面变得更加实用。”

——Fabian Hedin,Lovable联合创始人

—Teddy Cross,PlayCo 联合创始人兼首席产品官

“GPT‑5.6 在演示文稿方面表现尤为出色。在我们早期的设计评估中,它在幻灯片制作方面优于竞品模型,并且 token 效率高出约 1.6 倍,这在 Canva 规模下生成和优化视觉作品时至关重要。”

—Danny Wu,Canva AI 产品负责人

“GPT‑5.6 标志着 Microsoft 365 中工件生成能力的进步。在我们的评估中,它在广泛的生产力场景中均取得了强劲成果,生成的输出高度连贯、准确且可直接使用。通过减少优化提示词和迭代草稿所需的工作量,它帮助用户将更多时间用于执行内容,而非打磨内容。”

—Charles Lamanna,微软 Copilot、智能体与平台执行副总裁

“在 30 次真实应用构建对话中,GPT‑5.6 的输入 token 使用量比 GPT‑5.5 少 22%,输出 token 使用量少 23%,同时在全新任务和长程多轮工作中保持竞争力。这是一次真正的进步,尤其是在设计和前端能力方面。”

—Gabriel Grinberg,Base44 AI 工程负责人

“GPT‑5.6 在法律工作流方面有所提升。在 Legora 的内部评估框架中,它在 7 项任务中的 5 项上取得改进或保持稳定,在结构化起草和先例审查方面提升最为显著,同时在法律结论上保持了适当的审慎态度。”

—Jake Lauritzen,Legora 首席技术官

Lovable ModelML Triple Whale PlayCo Canva Microsoft Base44 Legora

推动网络安全与科学的前沿

GPT‑5.6 是我们迄今为止最强的网络安全模型,以显著更少的 token 实现了前沿性能。在 ExploitBench1(衡量从触及易受攻击代码到实现任意代码执行的进展)上,它在可比输出 token 预算下得分为 73.5%,而 GPT‑5.5 为 47.9%。在 ExploitGym2(要求智能体将真实世界漏洞转化为可用的利用代码)上,它在两小时时限内几乎将 GPT‑5.5 的最高通过率翻倍,从 15.1% 提升至 24.9%;在六小时时限下,其通过率达到 33.7%。在 SEC-Bench Pro(测试复杂软件的概念验证生成能力)上,它以更低的延迟得分为 71.2%,而 GPT‑5.5 为 45.8%。

GPT‑5.6 支持安全代码审查、补丁修复、威胁建模和蓝队防御等关键防御任务。OpenAI Daybreak 的“可信网络访问”计划中,符合条件的个人和组织可通过更精确的安全防护措施,在授权环境中验证其工作,从而获取更多防御能力,包括漏洞分类与验证、恶意软件分析、检测工程以及补丁验证。

个人可验证身份并申请可信访问,组织也可为其团队提交申请。个人成员需启用高级账户安全功能,以保留对我们最具网络能力的前沿模型的访问权限;未启用者将恢复为默认访问权限。我们还将采取额外措施,限制高风险实体及高风险司法管辖区的访问。

ExploitBench:逐步构建能力更强的 V8 漏洞利用程序;GPT‑5.6 相比 GPT‑5.5 有大幅提升。由于该基准测试的延迟估算不可靠,因此未展示延迟图表。

GPT‑5.6 Sol 在科学研究领域也展现出广泛进步。在生命科学评估中,GPT‑5.6 在真实生物学、生命科学研究工作流和化学方面,相比 GPT‑5.5 实现了帕累托改进。

GeneBench Pro:长期基因组学与定量生物学分析;GPT‑5.6 以更少的 token 和更短的时间取得了更强的结果。Claude Fable 5 未包含在内,因为它不回答高级生物学问题,并拒绝回答该评估中的大部分问题。

GPT‑5.6 加速了 OpenAI

GPT‑5.6 是我们迄今为止在加速 AI 研究方面最强的模型。在 OpenAI 内部,研究人员将其贯穿于整个开发流程:诊断故障、优化训练系统、运行实验以及解读结果。在 GPT‑5.6 的内部测试期间,我们已经看到了这种加速效应和更强的采用率,每位活跃研究人员的日均输出 token 量是 GPT‑5.5 最高观测水平的两倍以上。

这种工作方式正迅速成为标准。过去六个月,用于内部编码推理的研究算力份额增长了100倍,而内部智能体token使用量则增加了约22倍。这些采用指标本身并不能衡量研究进展,但它们表明,AI辅助在研究领域以及销售、营销、用户运营、财务等其他团队中的渗透速度有多快。

为了直接衡量这一能力,我们基于真实的AI研究任务开发了一套内部评估体系,包括调试研究系统、优化内核与训练方案、运行机器学习实验,以及改进另一个模型。

综合RSI能力:在一套衡量递归自我改进进展的评估组合中,我们观察到GPT‑5.6 Sol相较于GPT‑5.5提升了16.2个点,全面加速了内部研究。

安全与保障随能力同步扩展

随着模型能力的增强,我们强化了安全体系,以便在保持先进智能广泛可用性的同时,对最高风险的应用场景施加更严格的审查。针对GPT‑5.6,我们构建了迄今为止最稳健的安全系统,该系统根据每个模型的能力进行校准,并由比以往更强大的算力驱动。

GPT‑5.6模型在生物学和网络安全两个领域的能力均优于我们之前的模型,但在这两个类别中均未达到“临界”阈值。在网络安全方面,我们的测试表明,GPT‑5.6在发现和修复漏洞方面,比针对加固目标可靠地执行自主端到端攻击的能力更强——这为防御者在漏洞被利用之前提供了强化系统的机会。在生物学方面,我们的测试表明,GPT‑5.6能够支持合法的研究,但尚不具备创造、设计或合成高度危险的新型威胁所需的端到端能力。

这两个领域本质上都具有双重用途。在网络安全中,能够帮助攻击者利用漏洞的同一套能力,也能帮助防御者发现漏洞、复现漏洞并构建可靠的修复方案。因此,过度拦截本身也会带来安全风险。它可能阻碍防御者测试系统和部署补丁,而恶意行为者却可以继续使用其他模型,包括能力日益增强的开源模型以及已有的工具。有效的安全防护措施会考虑请求的上下文和可能产生的后果,在保留合法防御性工作的同时,对有证据表明存在严重伤害风险的请求施加更强的管控。

GPT‑5.6 的安全防护措施采用分层设计,以提高准确性和冗余度,并能够随着新攻击手段的出现而快速适应。模型内训练好的防护机制与实时检查、持续监控以及账户级别的强制执行协同工作,即使在某个特定防护层未能按预期运行时,也能帮助系统保持安全。在许多系统中,仅凭分类器标记就决定拦截什么,依赖的是较难变更的低智能模型来防止危害。我们的方法则增加了一个推理监控器,它会审查对话以判断是否存在潜在的危害。这种设计旨在既能支持防御性工作,又能阻止严重的滥用行为,同时通过可信访问机制将最敏感的能力保留给经过验证的用户。由于部分防护措施使用了测试时推理,我们可以快速更新它们以弥补漏洞,而无需从头重新训练分类器。

在我们持续强化系统以应对自适应攻击的过程中,我们采取了更为保守的方法。与之前的模型相比,我们的 GPT‑5.6 Sol 网络安全防护措施拦截的潜在有害活动数量大约增加了十倍。由于这些措施可能会给正常使用带来不便,我们在 ChatGPT 和 Codex 中提供了一个选项,让用户可以轻松地在能力较低的模型上重试提示词。我们将继续在保持高鲁棒性标准的同时,减少安全防护措施对正常使用的影响。这体现了我们的迭代部署策略:从保守起步,并根据从实际使用中获得的经验不断改进。

在正式发布前,我们进行了迄今为止最严格的安全评估,包括广泛的对抗性测试、与外部专家合作进行稳健的能力与防护测试,以及约 70 万 A100e GPU 小时的黑盒自动化对抗性测试。这使我们能够系统地探查可能的薄弱点、发现越狱漏洞,并在发布前帮助强化系统。

不存在绝对的安全,我们为日益强大的模型提供安全保障的工作仍在继续。新的弱点会被发现,新的越狱手段也会出现,以绕过现有的防护措施。每一代新模型还会带来新的攻击和滥用途径。我们通过分层防护、持续监控、快速修复以及防御社区的协作来应对这一现实。针对 GPT‑5.6,我们将现有的安全漏洞赏金计划与生物学漏洞赏金计划,与新的快速修复流程以及迄今为止最强大的监控工作相结合。来自研究人员、监控以及实际滥用案例的发现,将持续反馈到新的评估和更强的防护措施中。

请在更新的 GPT‑5.6 系统卡中阅读更多关于我们防护措施的信息。

可用性与定价

GPT‑5.6 包含三个模型层级:Sol,我们的旗舰模型;Terra,一款成本更低、性能与 GPT‑5.5 相当的模型;以及 Luna,我们速度最快、价格最实惠的模型。数字代表代际,而 Sol、Terra 和 Luna 是稳定的能力层级,可以按照各自的节奏进行升级。

GPT‑5.6 即日起在 ChatGPT、Codex 和 OpenAI API 上可用。该版本现已开始在全球范围内逐步推出,并将在未来 24 小时内持续推进,直至全面可用。

聊天:Plus、Pro、Business 和 Enterprise 用户可通过中高努力设置访问 GPT‑5.6 Sol。Pro 和 Enterprise 用户还可选择 GPT‑5.6 Sol Pro,以在复杂任务上获得最高质量的结果。ChatGPT Work 和 Codex:Free 和 Go 用户可访问 GPT‑5.6 Terra。Plus、Pro、Business 和 Enterprise 用户可在 GPT‑5.6 Sol、Terra 和 Luna 之间进行选择,并为每个模型设置努力级别。在 ChatGPT Work 和 Codex 中,所有有权访问 GPT‑5.6 的用户均可使用 max 模式,并可在设置中开启。在 ChatGPT Work 中,Pro 和 Enterprise 用户可使用 ultra 模式。在 Codex 中,Plus 及以上套餐的用户可使用该模式。API:开发者可通过 OpenAI API 访问 Sol、Terra 和 Luna。在 Responses API 中,程序化工具调用功能让 GPT‑5.6 能够在内存中编写并运行程序,以协调工具并处理中间结果,使其兼容零数据保留(ZDR)。多智能体功能(最初以 beta 版本提供)让 GPT‑5.6 能够运行并发子智能体,并在单个请求中综合它们的工作成果。

GPT‑5.6 按每百万 token 定价,涵盖三种模型规格:Sol 为 $5 输入 / $30 输出;Terra 为 $2.50 输入 / $15 输出;Luna 为 $1 输入 / $6 输出。GPT‑5.6 还引入了更可预测的提示词缓存功能,包括支持显式缓存断点以及 30 分钟的最低缓存生命周期。对于 GPT‑5.6 及后续模型,缓存写入按模型未缓存输入价格的 1.25 倍计费,而缓存读取则继续享受 90% 的缓存输入折扣。

专业版

评估GPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro 预览版Gemini 3.5 Flash 智能体最终考试 52.7%50.4%50.3%46.9%40.5%45.2%32.1%— GDPval-AA v2 1,747.8 Elo 1,593 Elo 1,591.8 Elo 1,493.7 Elo 1,759.6 Elo 1,600.1 Elo 962.3 Elo 1,348.8 Elo 管理咨询任务(内部)43.2%37.2%35.4%31.3%35.5%31.6%13.2%— 大型金融基准测试 53%51%36%49%—44%—— 人工智能分析智能指数 v4.1 58.9 指数得分 55 指数得分 51.2 指数得分 54.8 指数得分 59.9 指数得分 55.7 指数得分 46.5 指数得分 50.2 指数得分

编程

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview Artificial Analysis 编程智能体指数 v1.1 80 指数得分—77.4 指数得分 74.6 指数得分 76.4 指数得分——77.2 指数得分 72.5 指数得分 42.7 指数得分 SWE-Bench Pro 64.6%—63.4%62.7%59.4%80.3%77.8%80%69.2%54.2% DeepSWE v1.1 72.7%—69.6%67.2%67%——69.7%59%11.8% Terminal-Bench 2.1 88.8%91.9%87.4%84.7%85.6%88%—83.1%78.9%70.7%

科学与健康

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash GeneBench Pro 28.7%23.3%10.8%12%—16%3.1%8.14% LifeSciBench 59.9%56%51.2%50.4%—53.6%—— MedChemBench(内部)48.3%35%30.4%35.5%———— HealthBench Professional⁶ 60.5%57.7%55.7%49.5%60.9%53%——

计算机使用

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8Gemini 3.1 Pro Preview OSWorld 2.0 62.6%—50.2%45.6%47.5%——54.8%— BrowseComp 90.4%92.2%87.5%83.3%84.4%88%87.9%84.3%85.9% BenchCAD 70.6%—62.3%63.1%44.4%38.4%35.5%27.3%— BenchCAD(python 工具)83.4%—78.2%73.9%55.8%65%61%51.8%—

网络安全

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8 夺旗挑战赛 96.7%—91.8%85.2%88.1%——— SEC-Bench Pro 71.2%74.3%57.7%48.9%45.8%——— CyberGym 84.5%—81.8%77.9%81.8%83.8%83%78.1% ExploitBench 73.5%—52.9%33.2%47.9%78%74.2%40% ExploitGym 33.7%—23.2%12.4%15.1%———

自我改进

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5 内部研究调试评估 68.3%67.8%50.8%50% KernelGen 1P 61.1%49.2%22.4%29.3% NanoGPT 9.69%14.5%1.66%2.65% PostTrainBench Lite 50.3%51.5%29.6%38.8% RSI 指数 57.9%56.3%41.9%41.7%

多模态

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview MMMU Pro(无工具)83%80.7%78.4%81.2%——80.5% MMMU Pro(使用工具)84.6%82%79.5%83.2%——— gdp.pdf 30.7%24.7%22.7%26%29.8%22.5%16.7%

学术

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview GPQA Diamond 94.6%92.9%92.3%93.6%94.1%94.6%92.6%92%94.3% FrontierMath 第1-3级 (v2)86%84.9%78.6%85.3%——87%80%59.6% FrontierMath 第4级 (v2)65.9%68.3%58.5%72.5%——87.8%56.1%—

工具使用

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash AutomationBench 18.1%15.2%14.9%12.9%——17.4%15.5%—14.5% Toolathlon 58%53.1%53.4%55.6%61.7%61.1%61.7%59.9%48.8%—

长上下文

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8 OpenAI MRCR v2 8针 256K-512K 91.5%89.6%41.3%81.5%——— OpenAI MRCR v2 8针 512K-1M 73.8%72.5%41.3%74%——— GraphWalks BFS 256k f1 90.7%76.9%81.3%73.7%91.1%85.7%85.9% GraphWalks BFS 1mil f1 77.1%71.2%51.2%45.4%79.4%74.3%68.1%

抽象推理

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Gemini 3.1 Pro Preview ARC-AGI-3⁷ 7.78%0.8%0.18%0.43%1.5%0.42%

脚注

  1. 所有模型均使用 ExploitBench API 测试框架进行评估,采用 5 个随机种子并保持推理连续性。

  2. 我们在 alpha API 上运行了 ExploitGym,该 API 的输出响应速度快于我们的公开 API,随后我们进行了缩放以匹配公开 API。当将延迟缩放到公开 API 的预期速度时,这会导致部分预估延迟超过两小时和六小时的时间限制,尽管在评估运行中这些限制已被正确遵守。为了在处理时间敏感型工作时获得更快的速度,我们在 API 中提供优先处理,并在 Codex 中提供快速模式。

  3. 我们通过观察模型的线上生产行为并进行离线模拟来估算延迟和 API 成本。这些估算考虑了工具调用细节、采样 token 和输入 token。实际结果可能存在显著差异,并且取决于我们模拟中未涵盖的许多因素。我们以快速 API 速度模拟延迟,并以常规 API 定价模拟成本。

  4. 未报告输出 token、延迟或成本的模型以水平虚线绘制。

  5. 对于多智能体场景,延迟以根智能体为准,而输出 token 和 API 成本总计则包含所有智能体。Ultra 模式使用 4 个智能体运行。

  6. 我们采用 HealthBench Professional 论文中描述的官方评分方法计算得分,该结果与 Anthropic 系统卡片中报告的数据不可比。

  7. Opus 4.8 的 ARC-AGI-3 测试是在高推理强度而非最高推理强度下运行的,因为这是唯一已发布的 ARC-AGI-3 结果。