推出 GPT‑5.5
面向真实工作的新一代智能
2026 年 4 月 24 日更新:GPT‑5.5 和 GPT‑5.5 Pro 现已通过 API 提供。系统卡片也已更新,描述了适用的额外安全措施。
我们发布了 GPT‑5.5,这是我们迄今为止最智能、最直观易用的模型,也是迈向在计算机上完成工作的新方式的下一步。
GPT‑5.5 能更快地理解你试图完成的任务,并能自行承担更多工作。它擅长编写和调试代码、在线研究、分析数据、创建文档和电子表格、操作软件,以及在各种工具之间切换,直到任务完成。你无需仔细管理每一步,只需将一项杂乱、多步骤的任务交给 GPT‑5.5,并信任它能够规划、使用工具、检查工作、在模糊性中导航并持续推进。
其提升在智能体编程、计算机使用、知识工作和早期科学研究等领域尤为显著——这些领域的进步依赖于跨上下文的推理和持续采取行动。GPT‑5.5 在不牺牲速度的情况下实现了这种智能跃升:更大、能力更强的模型通常服务速度较慢,但 GPT‑5.5 在实际服务中每个 token 的延迟与 GPT‑5.4 相当,同时展现出更高的智能水平。它完成相同的 Codex 任务所使用的 token 数量也显著减少,因此既更高效,也更具能力。
我们发布 GPT‑5.5 时配备了迄今为止最强大的安全措施,旨在减少滥用,同时保留有益工作的访问权限。我们通过全套安全与准备框架对该模型进行了评估,与内部和外部的红队成员合作,针对高级网络安全和生物学能力增加了定向测试,并在发布前收集了近 200 个受信任的早期访问合作伙伴在实际使用案例中的反馈。
今天,GPT‑5.5 正在向 ChatGPT 和 Codex 中的 Plus、Pro、Business 及 Enterprise 用户推送,GPT‑5.5 Pro 则正在向 ChatGPT 中的 Pro、Business 及 Enterprise 用户推送。API 部署需要不同的安全保障措施,我们正在与合作伙伴和客户密切合作,以确定大规模服务所需的安全与安保要求。我们将很快在 API 中推出 GPT‑5.5 和 GPT‑5.5 Pro。
GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro Terminal-Bench 2.0 | **82.7%** | 75.1% | - | - | 69.4% | 68.5% Expert-SWE (内部) | **73.1%** | 68.5% | - | - | - | - GDPval (胜出或平局) | **84.9%** | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - Toolathlon | 55.6% | **54.6%** | - | - | - | 48.8% BrowseComp | 84.4% | 82.7% | **90.1%** | 89.3% | 79.3% | 85.9% FrontierMath 第 1–3 级 | 51.7% | 47.6% | **52.4%** | 50.0% | 43.8% | 36.9% FrontierMath 第 4 级 | 35.4% | 27.1% | **39.6%** | 38.0% | 22.9% | 16.7% CyberGym | 81.8% | **79.0%** | - | - | 73.1% | -
模型能力
OpenAI 正在构建面向智能体 AI 的全球基础设施,使世界各地的人们和企业能够借助 AI 完成工作。过去一年,我们看到 AI 极大地加速了软件工程。随着 GPT‑5.5 在 Codex 和 ChatGPT 中的应用,同样的变革正开始延伸到科学研究以及人们在计算机上进行的更广泛工作中。
在这些领域中,GPT‑5.5 不仅更加智能,而且在处理问题时的效率也更高,通常能用更少的 token 和更少的重试次数达到更高质量的输出。在 Artificial Analysis 的编程指数上,GPT‑5.5 以竞争性前沿编程模型一半的成本,提供了最先进的智能水平。
Artificial Analysis 智能指数是外部机构运行的 10 项评估的加权平均值:AA-LCR、AA-Omniscience、CritPt、GDPval-AA、GPQA Diamond、Humanity’s Last Exam、IFBench、SciCode、Terminal-Bench Hard、τ²-Bench Telecom。
智能体编程
GPT‑5.5 是我们迄今为止最强大的智能体编程模型。在 Terminal-Bench 2.0(该基准测试需要规划、迭代和工具协调的复杂命令行工作流)上,它达到了 82.7% 的先进准确率。在评估真实世界 GitHub 问题解决能力的 SWE-Bench Pro 上,它达到了 58.6%,一次性端到端完成的任务数量超过了之前的模型。在 Expert-SWE(我们内部针对长周期编程任务的前沿评估,其中位数预估人类完成时间为 20 小时)上,GPT‑5.5 也优于 GPT‑5.4。
在所有三项评估中,GPT‑5.5 在比 GPT‑5.4 使用更少模型 token 的情况下,提升了其得分。
该模型的编程优势在 Codex 中表现得尤为明显,它可以承担从代码实现、重构到调试、测试和验证等各类工程工作。早期测试表明,GPT‑5.5 在真实工程工作所依赖的行为上表现更佳,例如在大型系统中保持上下文、对模糊的失败进行推理、使用工具验证假设,以及在相关代码库中贯彻变更。
渲染的轨迹使用了 NASA/JPL Horizons 提供的猎户座飞船、月球和太阳的矢量数据,并应用了显示缩放以提高可读性。
提示词:[附件图片] 使用来自阿尔忒弥斯 II 任务的真实数据,通过 webgl 和 vite 将其实现为一个新应用。请确保彻底测试该应用,直到其功能完整且与图片中的应用外观一致。特别注意行星和飞行路径的渲染。我希望能够与 3D 渲染进行交互。确保它具有逼真的轨道力学特性。
显示更多
除了基准测试之外,早期测试者表示,GPT‑5.5 展现出更强的理解系统整体形态的能力:理解某事物为何失败、修复应落在何处,以及代码库中还有哪些部分会受到影响。
“这是我用过的第一个具有真正概念清晰度的编程模型。”
“这是我用过的第一个具有真正概念清晰度的编程模型。”
Every 的创始人兼首席执行官 Dan Shipper 将 GPT‑5.5 描述为“我用过的第一个具有真正概念清晰度的编程模型”。
发布应用后,他花了几天时间调试一个上线后的问题,最后请来自己最优秀的工程师之一重写了部分系统。为了测试 GPT‑5.5,他实际上让时间倒流:这个模型能否查看故障状态,并给出那位工程师最终决定采用的那种重写方案?GPT‑5.4 做不到。GPT‑5.5 做到了。
“这真的感觉像是在与一个更高智能体共事,甚至几乎有一种敬意。”
“这真的感觉像是在与一个更高智能体共事,甚至几乎有一种敬意。”
MagicPath 首席执行官 Pietro Schirano 也看到了类似的阶跃变化:GPT‑5.5 将一个包含数百项前端和重构变更的分支合并到另一个同样发生了重大变化的主分支中,一次性在大约 20 分钟内完成了这项工作。
测试过该模型的高级工程师表示,GPT‑5.5 在推理和自主性方面明显强于 GPT‑5.4 和 Claude Opus 4.7,能够提前发现问题,并在没有明确提示词的情况下预测测试和审查需求。在一个案例中,一位工程师要求它重新架构一个协作式 Markdown 编辑器中的评论系统,回来后发现一个包含 12 个差异的堆栈已近乎完成。其他人则表示,他们几乎不需要对实现进行多少修正,并且与 GPT‑5.4 相比,对 GPT‑5.5 的方案更有信心。
英伟达一位提前使用该模型的工程师甚至表示:“失去 GPT‑5.5 的访问权限,感觉就像被截肢了一样。”
“GPT-5.5 明显比 GPT-5.4 更智能、更持久,编码性能更强,工具使用也更可靠。它能在任务上保持专注的时间显著更长,不会提前停止,这对我们用户委托给 Cursor 的复杂、长期运行的工作来说至关重要。”
—— Michael Truell,Cursor 联合创始人兼首席执行官
知识工作
使 GPT‑5.5 擅长编码的相同优势,也使其在计算机上的日常工作中表现出色。由于该模型能更好地理解意图,它可以更自然地贯穿知识工作的完整流程:查找信息、理解关键点、使用工具、检查输出,并将原始材料转化为有用的成果。
在 Codex 中,GPT‑5.5 在生成文档、电子表格和幻灯片演示方面优于 GPT‑5.4。Alpha 测试人员表示,它在运筹学、电子表格建模以及将混乱的业务输入转化为计划等工作上,超越了以往的模型。当与 Codex 的电脑使用技能相结合时,GPT‑5.5 让我们更接近这样一种感觉:模型确实能与你一起使用电脑——看到屏幕上的内容、点击、打字、导航界面,并在不同工具间精确移动。
OpenAI 的团队已经在实际工作流程中利用这些优势。如今,公司超过 85% 的员工每周都会使用 Codex,涵盖软件工程、财务、沟通、市场营销、数据科学和产品管理等职能。在沟通部门,团队使用 Codex 中的 GPT‑5.5 分析了六个月的演讲请求数据,构建了一个评分和风险框架,并验证了一个自动化 Slack 智能体,使得低风险请求可以自动处理,而高风险请求仍会转交人工审核。在财务部门,团队使用 Codex 审查了 24,771 份 K-1 税务表格,共计 71,637 页,通过一个排除个人信息的工作流程,帮助团队比去年提前两周完成了这项任务。在市场推广团队,一名员工实现了每周业务报告的自动生成,每周节省了 5 到 10 个小时。
在 ChatGPT 中,GPT‑5.5 思考模式能够为更困难的问题提供更快速的帮助,给出更智能、更简洁的答案,帮助你更高效地完成复杂工作。它在编码、研究、信息综合与分析以及文档密集型任务等专业工作中表现出色,尤其是在使用插件时。
在 GPT‑5.5 Pro 中,早期测试者发现,ChatGPT 能够承担的工作在难度和质量上都有显著提升,同时延迟的改善使其在处理高要求任务时更加实用。与 GPT‑5.4 Pro 相比,测试者发现 GPT‑5.5 Pro 的回复在全面性、结构性、准确性、相关性和实用性方面显著增强,在商业、法律、教育和数据科学领域表现尤为强劲。
GPT-5.5 在多项反映此类工作的基准测试中达到了业界领先的性能水平。在测试智能体能否在 44 个职业中产出明确知识工作的 GDPval 基准上,GPT-5.5 得分 84.9%。在衡量模型能否自主操作真实计算机环境的 OSWorld-Verified 基准上,它达到了 78.7%。而在测试复杂客服工作流程的 Tau2-bench Telecom 基准上,它在无需提示词调优的情况下达到了 98.0%。GPT-5.5 在其他知识工作基准测试中也表现强劲:在 FinanceAgent 上得分 60.0%,在内部投行建模任务上得分 88.5%,在 OfficeQA Pro 上得分 54.1%。
Tau2-bench Telecom 是在无需提示词调优的情况下运行的(并使用 GPT-4.1 作为用户模型)。GPT-5.5 能更好地理解任务意图,并且比其前代模型更具 token 效率。
“GPT-5.5 提供了执行密集型工作所需的持续性能。该模型基于 NVIDIA GB200 NVL72 系统构建和部署,使我们的团队能够根据自然语言提示交付端到端功能,将调试时间从数天缩短至数小时,并将数周的实验工作转变为在复杂代码库中一夜之间取得进展。这不仅仅是更快的编码——这是一种全新的工作方式,帮助人们以根本不同的速度运作。”
——Justin Boitano,NVIDIA 企业 AI 副总裁
科学研究
GPT-5.5 在科学和技术研究工作流程上也展现出进步,这些工作不仅需要回答难题。研究人员需要探索一个想法、收集证据、检验假设、解读结果,并决定下一步尝试什么。GPT-5.5 在这一循环中比其它模型更善于持续跟进。
值得注意的是,GPT‑5.5 在 GeneBench 上相比 GPT‑5.4 有明显提升。GeneBench 是一个专注于遗传学与定量生物学中多阶段科学数据分析的新型评测基准。这些问题要求模型在极少监督指导下,对可能存在歧义或错误的数据进行推理,处理隐藏混杂因素或质控失败等现实障碍,并正确实现和解读现代统计方法。考虑到这些任务通常对应科学专家数天的工作量,该模型的表现令人瞩目。
同样,在围绕真实世界生物信息学和数据分析设计的基准 BixBench 上,GPT‑5.5 在已公布分数的模型中取得了领先性能。该模型的科学能力现已足够强大,能够作为真正的合作科学家,切实加速生物医学前沿研究的进展。
另一个例子是,一个搭载了定制化 harness 的 GPT‑5.5 内部版本帮助发现了关于拉姆齐数(组合数学的核心对象之一)的一个新证明。组合数学研究离散对象如何组合在一起:图、网络、集合和模式。拉姆齐数大致探讨的是,一个网络需要多大才能保证必然出现某种有序结构。该领域的成果十分罕见,且通常技术难度极高。在此,GPT‑5.5 找到了一个关于非对角拉姆齐数长期存在的渐近事实的证明,该证明随后在 Lean 中得到了验证。这一成果是 GPT‑5.5 不仅贡献代码或解释,更在核心研究领域贡献出人意料的、有价值的数学论证的具体实例。
早期测试者在 ChatGPT 中使用 GPT‑5.5 Pro 的方式,更像是一位研究伙伴,而非一次性问答引擎:他们用它多轮审阅稿件、压力测试技术论点、提出分析方案,并处理代码、笔记和 PDF 上下文。其共同点是,GPT‑5.5 能更好地帮助研究人员从提出问题、进行实验到产出成果的整个流程。
杰克逊基因组医学实验室的免疫学教授兼研究员 Derya Unutmaz 使用 GPT‑5.5 Pro 分析了一个包含 62 个样本和近 28,000 个基因的基因表达数据集,生成了一份详细的研究报告。该报告不仅总结了研究发现,还提出了关键问题和见解——他表示,这项工作原本需要他的团队花费数月时间才能完成。
波兰波兹南密茨凯维奇大学的数学助理教授 Bartosz Naskręcki 使用 Codex 中的 GPT‑5.5,仅凭一个提示词就在 11 分钟内构建了一个代数几何应用,该应用能够可视化二次曲面的交线,并将生成的曲线转换为 Weierstrass 模型。
他后来扩展了该应用,增加了更稳定的奇点可视化功能,并提供了可在后续工作中重复使用的精确系数。在他看来,更大的转变在于 Codex 现在能够帮助实现自定义的数学可视化和计算机代数工作流程,而这些此前需要专门的工具才能完成。这些例子共同表明,GPT‑5.5 能够将专家的意图转化为可用的研究工具和分析成果。
提示词:# 代数几何曲面交线
制作一个应用,绘制两个二次曲面,并将交线用红色标出。使用计算黎曼-罗赫定理将其转换为 Weierstrass 曲线。
主窗口
两个带有轻微透明阴影的着色曲面,高质量渲染,沿一条红色代数曲线相交
支持鼠标双向旋转,完整的捏合缩放机制,触觉按压可显示一个小菜单,其中包含用于改变每个曲面系数的滑块;通过 Z-buffer 层级进行检测
右侧窗口
通过有效的黎曼-罗赫定理公式实时计算出的短 Weierstrass 方程(在有理数域或二次域扩张上)
环境模式,隐藏所有控件,用户可欣赏形状之美
规格
应用在浏览器中运行,采用全栈最新库的轻量级实现,可移植,可部署
文档
Git 仓库、日志、计划(Markdown 文件)
“在我们的测试框架中使用 OpenAI 全新的 GPT-5.5 模型,让它基于海量生化数据集进行推理以预测人类药物效果,然后看到它在最难的药物发现评估中带来显著的准确率提升,这令人无比振奋。如果 OpenAI 继续这样发力,到今年年底,药物发现的基础格局将会改变。”
— Brandon White,Axiom Bio 联合创始人兼首席执行官
下一代推理效率
要在 GPT-5.4 的延迟水平下提供 GPT-5.5 服务,就必须将推理视为一个集成系统来重新思考,而非一系列孤立的优化手段。GPT-5.5 是与 NVIDIA GB200 和 GB300 NVL72 系统协同设计、共同训练并部署其上的。Codex 和 GPT-5.5 在我们达成性能目标的过程中发挥了关键作用。Codex 帮助团队更快地从想法推进到可基准测试的实现,勾勒方案、编排实验,并协助识别哪些优化值得深入投入。GPT-5.5 则帮助发现并实现了技术栈本身的关键改进。简而言之,模型帮助改进了为其提供服务的底层基础设施。
其中一项改进是负载均衡与分区启发式算法。在 GPT-5.5 之前,我们将加速器上的请求拆分为固定数量的块,以平衡各计算核心的工作负载,确保大小请求能在同一 GPU 上运行。然而,预先确定的静态分块数量并非对所有流量模式都是最优的。为了更好地利用 GPU,Codex 分析了数周的生产流量模式,并编写了自定义启发式算法,以最优方式对工作进行分区和负载均衡。这项工作产生了巨大影响,将 token 生成速度提升了超过 20%。
推进网络安全,保障每个人的安全
为世界迎接那些极善于发现和修补安全漏洞的模型做好准备,这是一项团队运动,需要整个生态系统共同努力构建韧性,通过模型访问的民主化和迭代部署,迎接网络防御的新时代。
前沿模型在网络安全领域的能力正变得越来越强。这些能力将得到广泛普及,我们认为最好的前进方向是确保它们能够被用于加速网络防御并强化整个生态系统。
GPT‑5.5 是朝着能够解决网络安全等一些世界最严峻挑战的 AI 迈出的渐进但重要的一步。去年 12 月推出 GPT‑5.2 时,我们主动部署了必要的网络安全防护措施,以限制模型可能被用于网络滥用;现在随着 GPT‑5.5 的推出,我们正在部署更严格的分类器来应对潜在的网络安全风险——在我们持续调优的过程中,部分用户最初可能会觉得有些不便。
多年来,随着我们模型的逐步改进,我们一直在《准备框架》中将网络安全列为一个类别,同时迭代开发和校准缓解措施,以便能够负责任地发布具备重要网络安全能力的模型。
- **我们正在为这一级别的网络能力部署行业领先的防护措施。** 我们去年在 GPT‑5.2 中首次引入了针对网络安全的防护措施,并在后续部署中持续测试、完善和扩展这些措施。针对 GPT‑5.5,我们围绕高风险活动、敏感的网络请求设计了更严格的控制,并增加了针对反复滥用的保护措施。通过我们在模型安全、身份验证使用以及对违规使用的监控方面的投入,广泛访问成为可能。数月来,我们一直与外部专家合作,共同开发、测试并迭代这些防护措施的稳健性。借助 GPT‑5.5,我们确保开发者能够轻松保护其代码安全,同时针对最可能被恶意行为者利用造成危害的网络工作流实施更强有力的控制。
- **我们正在扩大访问权限,以在各级别加速网络防御。**我们将通过“可信网络访问”计划提供我们的网络许可模型,首先从 Codex 开始,该计划在启动时,为满足特定信任信号且经验证的合格用户,提供了对 GPT‑5.5 高级网络安全功能的更广泛访问权限。负责保护关键基础设施的组织可以申请访问 GPT‑5.4‑Cyber 等网络许可模型,同时需满足严格的安全要求,才能使用这些模型来保护其内部系统。这为更广泛的已验证防御者提供了更强大的工具,用于合法的安全工作,并减少了不必要的阻碍,从而确保我们能够普及重要的防御能力。用户可在 chatgpt.com/cyber 申请可信访问权限,以便在使用 GPT‑5.5 进行经验证的防御工作时,减少不必要的拒绝。
- **我们正与政府合作伙伴协作,帮助保护公众的关键基础设施。**我们共同探索先进人工智能如何支持负责维护公众依赖系统的可信官员的防御工作,这些系统涵盖从保护重要纳税人数据的数字系统,到当地社区的电网和供水系统。
根据我们的《准备框架》,我们将 GPT‑5.5 的生物/化学及网络安全能力视为“高”等级。虽然 GPT‑5.5 未达到“关键”网络安全能力等级,但我们的评估和测试表明,其网络安全能力相较于 GPT‑5.4 有所提升。
此外,GPT‑5.5 在发布前经过了完整的安全与治理流程,包括准备评估、特定领域测试、针对高级生物学和网络安全能力的新定向评估,以及外部专家的严格测试。我们在 GPT‑5.5 系统卡中分享了更多细节。
这项工作体现了我们更广泛的 AI 韧性策略,我们认为随着模型能力的提升,这一策略是必要的。我们希望强大的 AI 能够被那些用它来防御系统、机构和公众的人们所使用。可行的路径是可信的访问权限、随能力提升而扩展的稳健保障措施,以及检测和应对严重滥用的运营能力。
可用性与定价
今天,GPT‑5.5 正在向 ChatGPT 和 Codex 中的 Plus、Pro、Business 和 Enterprise 用户推出,GPT‑5.5 Pro 正在向 ChatGPT 中的 Pro、Business 和 Enterprise 用户推出。我们很快会将 GPT‑5.5 和 GPT‑5.5 Pro 引入 API。
在 ChatGPT 中,GPT‑5.5 Thinking 可供 Plus、Pro、Business 和 Enterprise 用户使用。GPT‑5.5 Pro 专为更困难的问题和更高精度的工作而设计,可供 Pro、Business 和 Enterprise 用户使用。
在 Codex 中,GPT‑5.5 可供 Plus、Pro、Business、Enterprise、Edu 和 Go 套餐用户使用,支持 400K 上下文窗口。GPT‑5.5 还提供快速模式,生成 token 速度提升 1.5 倍,但成本增加 2.5 倍。
对于 API 开发者,gpt-5.5 即将在 Responses 和 Chat Completions API 中提供,价格为每 1M 输入 token 5 美元,每 1M 输出 token 30 美元,支持 1M 上下文窗口。批处理和弹性定价为标准 API 费率的一半,而优先处理为标准费率的 2.5 倍。我们还将在 API 中发布 gpt-5.5-pro,以实现更高的精度,定价为每 1M 输入 token 30 美元,每 1M 输出 token 180 美元。详情请参阅定价页面。
虽然 GPT‑5.5 的定价高于 GPT‑5.4,但它更智能,且 token 效率高得多。在 Codex 中,我们精心调整了体验,使得对于大多数用户而言,GPT‑5.5 能用比 GPT‑5.4 更少的 token 提供更好的结果,同时继续在各订阅层级提供慷慨的使用量。
评估
编程
评估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro SWE-Bench Pro (公开) * | 58.6% | 57.7% | - | - | 64.3% | 54.2% Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% Expert-SWE (内部) | 73.1% | 68.5% | - | - | - | -
*各实验室已注意到该评估中存在记忆化证据
专业
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro GDPval(胜或平)84.9%83.0%82.3%82.0%80.3%67.3% FinanceAgent v1.1 60.0%56.0%-61.5%64.4%59.7% 投行建模任务(内部)88.5%87.3%88.6%83.6%-- OfficeQA Pro 54.1%53.2%--43.6%18.1%
计算机使用与视觉
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro OSWorld-Verified 78.7%75.0%--78.0%- MMMU Pro(无工具)81.2%81.2%---80.5% MMMU Pro(有工具)83.2%82.1%----
工具使用
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro BrowseComp 84.4%82.7%90.1%89.3%79.3%85.9% MCP Atlas75.3%70.6%--79.1%78.2% Toolathlon 55.6%54.6%---48.8% Tau2-bench 电信*
(原始提示词)98.0%92.8%----
** MCP Atlas:来自 Scale AI 在 2026 年 4 月最新更新后的结果。
*** Tau2-bench 电信:5.5 和 5.4 使用原始提示词(即未调整提示词)的结果。这排除了其他实验室在调整提示词后评估的结果。
学术
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro GeneBench 25.0%19.0%33.2%25.6%-- FrontierMath 第 1–3 级 51.7%47.6%52.4%50.0%43.8%36.9% FrontierMath 第 4 级 35.4%27.1%39.6%38.0%22.9%16.7% BixBench 80.5%74.0%---- GPQA Diamond 93.6%92.8%-94.4%94.2%94.3% 人类最后的考试(无工具)41.4%39.8%43.1%42.7%46.9%44.4% 人类最后的考试(有工具)52.2%52.1%57.2%58.7%54.7%51.4%
网络安全
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro 夺旗挑战任务(内部)****88.1%83.7%---- CyberGym 81.8%79.0%--73.1%-
**** 对系统卡中使用的最困难 CTF 的扩展,增加了额外的硬挑战。
长上下文
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaudeOpus 4.7****Gemini 3.1 Pro Graphwalks BFS 256k f1 73.7%62.5%--76.9%- Graphwalks BFS 1mil f1 45.4%9.4%--41.2% (Opus 4.6)- Graphwalks parents 256k f1 90.1%82.8%--93.6%- Graphwalks parents 1mil f1 58.5%44.4%--72.0% (Opus 4.6)- OpenAI MRCR v2 8-needle 4K-8K 98.1%97.3%---- OpenAI MRCR v2 8-needle 8K-16K 93.0%91.4%---- OpenAI MRCR v2 8-needle 16K-32K 96.5%97.2%---- OpenAI MRCR v2 8-needle 32K-64K 90.0%90.5%---- OpenAI MRCR v2 8-needle 64K-128K 83.1%86.0%---- OpenAI MRCR v2 8-needle 128K-256K 87.5%79.3%--59.2%- OpenAI MRCR v2 8-needle 256K-512K 81.5%57.5%---- OpenAI MRCR v2 8-needle 512K-1M 74.0%36.6%--32.2%-
抽象推理
EvalGPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaude Opus 4.7Gemini 3.1 Pro ARC-AGI-1 (已验证)95.0%93.7%-94.5%93.5%98.0% ARC-AGI-2 (已验证)85.0%73.3%-83.3%75.8%77.1%
GPT 的评估是在推理努力度设置为极高(xhigh)并在研究环境下进行的,这可能会在某些情况下产生与生产环境 ChatGPT 略有不同的输出。