2026年4月24日更新:GPT‑5.5和GPT‑5.5 Pro现已在API中提供。系统卡也已更新,描述了适用的额外安全措施。
我们发布了GPT‑5.5,这是我们迄今为止最智能、最直观易用的模型,也是迈向在计算机上完成工作的新方式的下一步。
GPT‑5.5能更快地理解你试图完成的任务,并能自行承担更多工作。它擅长编写和调试代码、在线研究、分析数据、创建文档和电子表格、操作软件,以及在多个工具之间切换,直到任务完成。你无需仔细管理每一步,只需将一项杂乱、多步骤的任务交给GPT‑5.5,它就能自主规划、使用工具、检查工作、应对模糊性并持续推进。
其提升在智能体编程、计算机使用、知识工作和早期科学研究等领域尤为显著——这些领域的进步依赖于跨上下文的推理和持续行动。GPT‑5.5在实现这一智能跃升的同时并未牺牲速度:更大、能力更强的模型通常服务响应更慢,但GPT‑5.5在实际服务中每个token的延迟与GPT‑5.4相当,同时智能水平大幅提升。此外,完成相同的Codex任务时,它使用的token数量显著减少,因此不仅能力更强,效率也更高。
我们发布GPT‑5.5时配备了迄今为止最强大的安全措施,旨在减少滥用,同时保留有益工作的使用权限。我们在全套安全与准备框架下对该模型进行了评估,与内部和外部红队合作,增加了针对高级网络安全和生物学能力的定向测试,并在发布前收集了近200家值得信赖的早期访问合作伙伴在实际使用案例中的反馈。
今天,GPT‑5.5正在向ChatGPT和Codex中的Plus、Pro、Business和Enterprise用户推出,GPT‑5.5 Pro正在向ChatGPT中的Pro、Business和Enterprise用户推出。API部署需要不同的安全措施,我们正与合作伙伴和客户密切合作,以满足大规模服务的安全要求。我们将很快把GPT‑5.5和GPT‑5.5 Pro引入API。
GPT‑5.5GPT‑5.4GPT‑5.5 ProGPT‑5.4 ProClaude Opus 4.7Gemini 3.1 Pro Terminal-Bench 2.082.7%75.1%--69.4%68.5% Expert-SWE(内部)73.1%68.5%---- GDPval(胜或平)84.9%83.0%82.3%82.0%80.3%67.3% OSWorld-Verified78.7%75.0%--78.0%- Toolathlon55.6%54.6%---48.8% BrowseComp 84.4%82.7%90.1%89.3%79.3%85.9% FrontierMath 第 1–3 层 51.7%47.6%52.4%50.0%43.8%36.9% FrontierMath 第 4 层 35.4%27.1%39.6%38.0%22.9%16.7% CyberGym81.8%79.0%--73.1%-
模型能力
OpenAI 正在构建面向智能体 AI 的全球基础设施,让世界各地的个人和企业都能借助 AI 完成工作。过去一年里,我们看到 AI 极大地加速了软件工程。随着 GPT‑5.5 在 Codex 和 ChatGPT 中的应用,同样的变革正开始延伸到科学研究以及人们在计算机上完成的更广泛工作。
在这些领域中,GPT‑5.5 不仅更智能,而且在处理问题时的效率也更高,通常能用更少的 token 和更少的重试次数达到更高质量的输出。在 Artificial Analysis 的编程指数上,GPT‑5.5 以竞争性前沿编程模型一半的成本,提供了最先进的智能水平。
Artificial Analysis 智能指数是外部机构运行的 10 项评测的加权平均值:AA-LCR、AA-Omniscience、CritPt、GDPval-AA、GPQA Diamond、Humanity’s Last Exam、IFBench、SciCode、Terminal-Bench Hard、τ²-Bench Telecom。
智能体编程
GPT‑5.5 是我们迄今为止最强的智能体编程模型。在 Terminal-Bench 2.0(测试需要规划、迭代和工具协调的复杂命令行工作流)上,它达到了 82.7% 的最先进准确率。在 SWE-Bench Pro(评估真实世界 GitHub 问题解决能力)上,它达到了 58.6%,单次通过即可端到端解决的任务数量超过以往模型。在 Expert-SWE(我们内部的前沿评测,针对人类预估完成时间中位数为 20 小时的长期编程任务)上,GPT‑5.5 同样优于 GPT‑5.4。
在所有这三项评测中,GPT‑5.5 在使用更少 token 的情况下,相比 GPT‑5.4 的得分均有提升。
该模型的编码优势在 Codex 中表现得尤为突出,它能够承担从实现、重构到调试、测试和验证等一系列工程工作。早期测试表明,GPT‑5.5 在实际工程工作所依赖的行为上表现更佳,例如在大型系统中保持上下文、通过模糊的失败信息进行推理、借助工具验证假设,以及在周边代码库中贯彻变更。
渲染轨迹使用了 NASA/JPL Horizons 的猎户座飞船、月球和太阳的矢量数据,并进行了显示缩放以提升可读性。
提示词:[附件图片] 使用 WebGL 和 Vite,基于阿尔忒弥斯 II 任务的真实数据,将此项实现为一个新应用。请彻底测试该应用,直至其功能完备且外观与图片中的应用一致。请特别注意行星和飞行路径的渲染。我希望能够与 3D 渲染进行交互。确保其具有逼真的轨道力学效果。
显示更多
除了基准测试之外,早期测试者表示,GPT‑5.5 展现出更强的理解系统架构的能力:理解某事物为何失败、修复应落在何处,以及代码库中还有哪些部分会受到影响。
“这是我用过的第一个具备真正概念清晰度的编码模型。”
“这是我用过的第一个具备真正概念清晰度的编码模型。”
Every 的创始人兼首席执行官 Dan Shipper 将 GPT‑5.5 描述为“我用过的第一个具备真正概念清晰度的编码模型。”
在发布一个应用后,他花了数天时间调试一个上线后的问题,随后才请来他最好的工程师之一重写了部分系统。为了测试 GPT‑5.5,他有效地让时间倒流:该模型能否审视出故障的状态,并产生与工程师最终决定相同的重写方案?GPT‑5.4 做不到。GPT‑5.5 做到了。
“这真的感觉像是在与一个更高级的智能体合作,甚至几乎有一种敬意。”
“这真的感觉像是在与一个更高级的智能体合作,甚至几乎有一种敬意。”
MagicPath 首席执行官 Pietro Schirano 也观察到了类似的阶跃式变化:GPT‑5.5 将一个包含数百项前端和重构变更的分支合并到同样发生了重大变化的主分支中,一次性解决了合并工作,耗时约 20 分钟。
测试过该模型的高级工程师表示,GPT‑5.5 在推理和自主性方面明显强于 GPT‑5.4 和 Claude Opus 4.7,能够提前发现问题,并在无需明确提示的情况下预测测试和审查需求。在一个案例中,一位工程师要求它重新架构协作式 Markdown 编辑器中的评论系统,返回时发现它已经生成了一个包含 12 个差异堆栈、近乎完成的方案。其他工程师表示,他们几乎不需要对实现进行修正,与 GPT‑5.4 相比,对 GPT‑5.5 的方案更有信心。
英伟达一位提前使用该模型的工程师甚至表示:“失去 GPT‑5.5 的访问权限,感觉就像被截肢了一样。”
“GPT-5.5 比 GPT-5.4 明显更聪明、更持久,编码性能更强,工具使用也更可靠。它能在更长时间内持续执行任务而不会提前停止,这对于用户委托给 Cursor 的复杂、长期运行的工作来说至关重要。”
—— Michael Truell,Cursor 联合创始人兼首席执行官
知识工作
使 GPT‑5.5 在编程方面表现出色的那些优势,同样使其在计算机上的日常工作中表现强大。由于该模型能更好地理解意图,它可以更自然地完成知识工作的完整闭环:查找信息、理解关键点、使用工具、检查输出,并将原始材料转化为有用的成果。
在 Codex 中,GPT‑5.5 在生成文档、电子表格和演示文稿方面优于 GPT‑5.4。Alpha 测试者表示,它在运筹学、电子表格建模以及将杂乱的业务输入转化为计划等工作上,超越了以往的模型。当与 Codex 的计算机使用技能相结合时,GPT‑5.5 让我们更接近这样一种体验:模型能真正与你一起使用计算机——看到屏幕上的内容、点击、打字、导航界面,并在不同工具之间精确操作。
OpenAI 的各个团队已在真实工作流程中运用这些优势。如今,公司超过 85% 的员工每周都会使用 Codex,涵盖软件工程、财务、沟通、市场营销、数据科学和产品管理等职能。在沟通部门,团队利用 Codex 中的 GPT‑5.5 分析了六个月的演讲请求数据,构建了评分与风险框架,并验证了一个自动化 Slack 智能体,使得低风险请求能够自动处理,而高风险请求仍会转交人工审核。在财务部门,团队使用 Codex 审核了 24,771 份 K-1 税表,共计 71,637 页,其工作流程排除了个人信息,帮助团队比去年提前两周完成了任务。在市场推广团队,一名员工实现了每周业务报告的自动生成,每周节省 5 到 10 个小时。
在 ChatGPT 中,GPT‑5.5 Thinking 能针对更棘手的问题提供更快的帮助,给出更智能、更简洁的答案,助你更高效地推进复杂工作。它在编程、研究、信息综合与分析以及文档密集型任务等专业工作中表现出色,尤其是在使用插件时。
在 GPT‑5.5 Pro 中,早期测试者发现 ChatGPT 所能承担工作的难度和质量均有显著提升,同时延迟的改善使其在处理高要求任务时更加实用。与 GPT‑5.4 Pro 相比,测试者认为 GPT‑5.5 Pro 的回复在全面性、结构清晰度、准确性、相关性和实用性方面均有显著提升,在商业、法律、教育和数据科学领域表现尤为强劲。
GPT‑5.5 在多项反映此类工作的基准测试中达到了业界领先水平。在测试智能体能否在 44 个职业中完成规范的知识型工作的 GDPval 基准上,GPT‑5.5 得分 84.9%。在衡量模型能否自主操作真实计算机环境的 OSWorld-Verified 上,它达到了 78.7%。而在测试复杂客服工作流的 Tau2-bench Telecom 上,它无需提示词调优便达到了 98.0%。GPT‑5.5 在其他知识工作基准上也表现强劲:在 FinanceAgent 上得分 60.0%,在内部投行建模任务上得分 88.5%,在 OfficeQA Pro 上得分 54.1%。
Tau2-bench Telecom 在未进行提示词调优的情况下运行(并使用 GPT‑4.1 作为用户模型)。GPT‑5.5 能更好地理解任务意图,且相比前代模型在 token 使用上更高效。
“GPT‑5.5 提供了执行密集型工作所需的持续性能。该模型基于 NVIDIA GB200 NVL72 系统构建和部署,使我们的团队能够从自然语言提示词出发交付端到端功能,将调试时间从数天缩短至数小时,并在复杂代码库中将数周的实验工作转化为一夜之间的进展。这不仅仅是更快的编码——这是一种全新的工作方式,帮助人们以根本不同的速度运转。”
—— Justin Boitano,NVIDIA 企业 AI 副总裁
科学研究
GPT‑5.5 在科学和技术研究工作流上也展现出进步,这类工作流需要的不仅仅是回答一个难题。研究人员需要探索一个想法、收集证据、检验假设、解读结果,并决定下一步尝试什么。GPT‑5.5 在这一循环中的持续能力优于其他模型。
值得注意的是,GPT‑5.5 在 GeneBench 上相比 GPT‑5.4 有显著提升。GeneBench 是一个专注于遗传学与定量生物学中多阶段科学数据分析的新评测基准。这些问题要求模型在极少监督指导下,对可能存在歧义或错误的数据进行推理,处理隐藏混杂因素或质控失败等现实障碍,并正确实现和解读现代统计方法。考虑到这些任务通常相当于科学专家耗时数日的项目,该模型的表现令人瞩目。
同样,在围绕真实世界生物信息学和数据分析设计的 BixBench 基准上,GPT‑5.5 在已公布分数的模型中取得了领先性能。该模型的科学能力现已足够强大,能够作为真正的合作科学家,切实加速生物医学研究前沿的进展。
另一个例子是,一个配备了定制化测试框架的内部版 GPT‑5.5 帮助发现了关于拉姆齐数的一个新证明,拉姆齐数是组合学中的核心研究对象之一。组合学研究离散对象如何组合在一起:图、网络、集合和模式。拉姆齐数大致探讨的是,一个网络需要多大才能保证必然出现某种有序结构。该领域的成果稀少且通常技术难度极高。在此,GPT‑5.5 找到了一个关于非对角拉姆齐数长期存在的渐近事实的证明,该证明随后在 Lean 中得到了验证。这一结果具体展示了 GPT‑5.5 不仅贡献代码或解释,更能在核心研究领域提出出人意料且有用的数学论证。
早期测试者在 ChatGPT 中使用 GPT‑5.5 Pro 时,并非将其视为一次性问答引擎,而是更像一位研究伙伴:它能够多轮审阅手稿、对技术论点进行压力测试、提出分析方案,并与代码、笔记及 PDF 上下文协同工作。其共同点是,GPT‑5.5 能更好地帮助研究人员从提出问题,到设计实验,再到产出成果的整个流程。
杰克逊基因组医学实验室的免疫学教授兼研究员 Derya Unutmaz 使用 GPT‑5.5 Pro 分析了一个包含 62 个样本和近 28,000 个基因的基因表达数据集,生成了一份详细的研究报告。该报告不仅总结了研究发现,还提出了关键问题与见解——他表示,这项工作如果由他的团队来做,需要花费数月时间。
波兰波兹南亚当·密茨凯维奇大学的数学助理教授 Bartosz Naskręcki 使用 Codex 中的 GPT‑5.5,仅凭一条提示词在 11 分钟内构建了一个代数几何应用,该应用能够可视化二次曲面的交线,并将生成的曲线转换为 Weierstrass 模型。
他随后扩展了该应用,加入了更稳定的奇点可视化功能以及可在后续工作中重复使用的精确系数。对他来说,更大的转变在于,Codex 现在能够帮助实现以往需要专用工具才能完成的定制化数学可视化与计算机代数工作流。这些例子共同展示了 GPT‑5.5 如何将专家的意图转化为可用的研究工具与分析成果。
图片来源:Bartosz Naskręcki
提示词:# 代数几何曲面交线
制作一个应用,绘制两个二次曲面,并将交线以红色标出。使用计算黎曼-罗赫定理将其转换为 Weierstrass 曲线。
主窗口
两个带有轻微透明着色的半透明曲面,高质量渲染,沿一条红色代数曲线相交
支持鼠标双向旋转、完整捏合缩放手势、触感按压弹出小菜单,菜单中包含用于改变每个曲面系数的滑块;通过 Z-buffer 层级进行检测
右侧窗口
通过有效的黎曼-罗赫定理公式实时计算出的短 Weierstrass 方程(在有理数域或二次域扩张上)
环境模式,隐藏所有控件,用户可欣赏形状之美
规格
应用在浏览器中运行,采用全栈最新库的轻量级实现,可移植,可部署
文档
Git 仓库、日志、计划(Markdown 文件)
显示更多
“在我们的测试框架中使用 OpenAI 的新 GPT-5.5 模型,让它对海量生化数据集进行推理以预测人类药物效果,然后看到它在最难的药物发现评估中带来显著的准确率提升,这令人无比振奋。如果 OpenAI 继续这样发力,到今年年底,药物发现的基础将发生改变。”
— Brandon White,Axiom Bio 联合创始人兼首席执行官
下一代推理效率
以 GPT-5.4 的延迟来服务 GPT-5.5,需要将推理视为一个集成系统,而非一组孤立的优化措施。GPT-5.5 是为 NVIDIA GB200 和 GB300 NVL72 系统协同设计、训练并部署的。Codex 和 GPT-5.5 在我们实现性能目标的过程中发挥了关键作用。Codex 帮助团队更快地从想法过渡到可基准测试的实现,勾勒方法、连接实验,并帮助识别哪些优化值得深入投入。GPT-5.5 则帮助发现并实现了技术栈本身的关键改进。简而言之,这个模型帮助改进了服务于它的基础设施。
其中一项改进是负载均衡与分区启发式算法。在 GPT-5.5 之前,我们将加速器上的请求拆分为固定数量的数据块,以平衡计算核心之间的工作负载,确保大小请求能在同一 GPU 上运行。然而,固定数量的静态数据块并非对所有流量模式都最优。为了更好地利用 GPU,Codex 分析了数周的生产流量模式,并编写了自定义启发式算法,以实现最优分区和负载均衡。这项工作产生了巨大影响,将 token 生成速度提升了超过 20%。
推进网络安全,保障每个人的安全
让世界为那些非常擅长发现和修补安全漏洞的模型做好准备,是一项团队运动,需要整个生态系统共同努力构建韧性,通过民主化的模型访问和迭代部署,迎接网络防御的下一个时代。
前沿模型在网络安全领域的能力正变得越来越强。这些能力将广泛分布,我们认为最佳的前进道路是确保它们能够被用于加速网络防御并强化整个生态系统。
GPT-5.5 是朝着能够解决网络安全等世界最严峻挑战的 AI 迈出的渐进但重要的一步。去年 12 月,借助 GPT-5.2,我们主动部署了必要的网络安全防护措施,以限制模型可能被用于网络滥用;现在,随着 GPT-5.5 的推出,我们正在部署更严格的分类器来应对潜在的网络风险——在我们逐步调整优化这些分类器的过程中,部分用户最初可能会感到不便。
多年来,随着我们模型的逐步改进,我们一直在《准备框架》中将网络安全确定为一个类别,同时我们迭代地开发和校准缓解措施,以便能够负责任地发布具备重要网络安全能力的模型。
我们正在为这一级别的网络能力部署行业领先的安全保障措施。去年,我们首次在 GPT‑5.2 中引入了针对网络安全的专门保障措施,并在后续部署中持续对其进行测试、完善和强化。针对 GPT‑5.5,我们围绕高风险活动、敏感网络请求设计了更严格的控制措施,并增加了针对反复滥用的防护。广泛的访问权限得益于我们在模型安全、身份验证使用以及监控违规使用方面的投入。数月来,我们一直与外部专家合作,共同开发、测试并迭代这些保障措施的稳健性。借助 GPT‑5.5,我们确保开发者能够轻松保护其代码安全,同时针对最可能被恶意行为者利用的网络工作流实施更强有力的控制。我们正在扩大访问权限,以在各个层面加速网络防御。我们通过“网络可信访问”计划提供我们的网络许可模型,首先从 Codex 开始,其中包括对 GPT‑5.5 高级网络安全能力的扩展访问,对于满足特定信任信号且在发布时通过验证的用户,限制更少。负责保护关键基础设施的组织可以申请访问 GPT‑5.4‑Cyber 等网络许可模型,同时需满足严格的安全要求,才能使用这些模型来保护其内部系统。这为更多经过验证的防御者提供了更强大的工具,用于合法的安全工作,并减少了不必要的摩擦,以确保我们能够普及重要的防御能力。用户可以在 chatgpt.com/cyber 申请可信访问,以便在使用 GPT‑5.5 进行经过验证的防御工作时减少不必要的拒绝。我们正在与政府合作伙伴合作,共同保护公众的关键基础设施。我们正在共同探索先进人工智能如何支持负责保护人们所依赖系统的可信官员的防御工作,这些系统涵盖从保护重要纳税人数据的数字系统,到地方社区的电网和供水系统。
根据我们的《准备框架》,我们将 GPT‑5.5 在生物/化学及网络安全方面的能力评定为“高”等级。虽然 GPT‑5.5 未达到“关键”网络安全能力等级,但我们的评估和测试表明,其网络安全能力相比 GPT‑5.4 有了显著提升。
此外,GPT‑5.5 在发布前经过了完整的安全与治理流程,包括准备评估、领域专项测试、针对高级生物学和网络安全能力的新定向评估,以及外部专家的严格测试。我们在 GPT‑5.5 系统卡中分享了更多细节。
这项工作体现了我们更广泛的人工智能韧性策略——我们认为随着模型能力的提升,这一策略至关重要。我们希望强大的 AI 能够被用于防御系统、机构和公众的人们所使用。可行的路径是:可信的访问权限、随能力同步扩展的稳健防护措施,以及检测和应对严重滥用的运营能力。
可用性与定价
今天,GPT‑5.5 正在向 ChatGPT 和 Codex 中的 Plus、Pro、Business 和 Enterprise 用户推出,GPT‑5.5 Pro 正在向 ChatGPT 中的 Pro、Business 和 Enterprise 用户推出。我们将很快在 API 中提供 GPT‑5.5 和 GPT‑5.5 Pro。
在 ChatGPT 中,GPT‑5.5 Thinking 可供 Plus、Pro、Business 和 Enterprise 用户使用。GPT‑5.5 Pro 专为更困难的问题和更高精度的工作而设计,可供 Pro、Business 和 Enterprise 用户使用。
在 Codex 中,GPT‑5.5 可供 Plus、Pro、Business、Enterprise、Edu 和 Go 计划用户使用,上下文窗口为 400K。GPT‑5.5 还提供快速模式,生成 token 速度提升 1.5 倍,成本增加 2.5 倍。
对于 API 开发者,gpt-5.5 即将在 Responses 和 Chat Completions API 中提供,定价为每 1M 输入 token 5 美元、每 1M 输出 token 30 美元,上下文窗口为 1M。Batch 和 Flex 定价为标准 API 费率的一半,Priority 处理为标准费率的 2.5 倍。我们还将发布 gpt-5.5-pro 的 API,提供更高精度,定价为每 1M 输入 token 30 美元、每 1M 输出 token 180 美元。完整详情请参见定价页面。
虽然 GPT‑5.5 的定价高于 GPT‑5.4,但它不仅更智能,而且 token 效率也高得多。在 Codex 中,我们精心调整了体验,使得对于大多数用户而言,GPT‑5.5 能用比 GPT‑5.4 更少的 token 带来更好的结果,同时继续在各订阅层级提供慷慨的使用量。
评测
编程
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro SWE-Bench Pro (公开版) | 58.6% | 57.7% | - | - | 64.3% | 54.2% Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% Expert-SWE (内部) | 73.1% | 68.5% | - | - | - | -
实验室已注意到该评测中存在记忆化的证据
专业领域
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro GDPval (胜出或平局) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% FinanceAgent v1.1 | 60.0% | 56.0% | - | 61.5% | 64.4% | 59.7% 投资银行建模任务 (内部) | 88.5% | 87.3% | 88.6% | 83.6% | - | - OfficeQA Pro | 54.1% | 53.2% | - | - | 43.6% | 18.1%
计算机使用与视觉
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - MMMU Pro (无工具) | 81.2% | 81.2% | - | - | - | 80.5% MMMU Pro (带工具) | 83.2% | 82.1% | - | - | - | -
工具使用
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% MCP Atlas | 75.3% | 70.6% | - | - | 79.1% | 78.2% Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% Tau2-bench 电信
(原始提示词) | 98.0% | 92.8% | - | - | - | -
MCP Atlas:来自 Scale AI 在 2026 年 4 月最新更新后的结果。
Tau2-bench 电信:5.5 和 5.4 使用原始提示词(即未调整提示词)的结果。这排除了其他实验室在调整提示词后进行的评测结果。
学术领域
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro GeneBench | 25.0% | 19.0% | 33.2% | 25.6% | - | - FrontierMath 第 1–3 级 | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% FrontierMath 第 4 级 | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% BixBench | 80.5% | 74.0% | - | - | - | - GPQA Diamond | 93.6% | 92.8% | - | 94.4% | 94.2% | 94.3% 人类最后的考试 (无工具) | 41.4% | 39.8% | 43.1% | 42.7% | 46.9% | 44.4% 人类最后的考试 (带工具) | 52.2% | 52.1% | 57.2% | 58.7% | 54.7% | 51.4%
网络安全
评测项 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro 夺旗挑战任务 (内部) | 88.1% | 83.7% | - | - | - | - CyberGym | 81.8% | 79.0% | - | - | 73.1% | -
这是系统卡中所用最困难 CTF 的扩展版本,并增加了额外的挑战。
长上下文
EvalGPT-5.5GPT-5.4GPT-5.5 ProGPT-5.4 ProClaude Opus 4.7Gemini 3.1 Pro Graphwalks BFS 256k f1 73.7%62.5%--76.9%- Graphwalks BFS 1mil f1 45.4%9.4%--41.2% (Opus 4.6)- Graphwalks parents 256k f1 90.1%82.8%--93.6%- Graphwalks parents 1mil f1 58.5%44.4%--72.0% (Opus 4.6)- OpenAI MRCR v2 8-needle 4K-8K 98.1%97.3%---- OpenAI MRCR v2 8-needle 8K-16K 93.0%91.4%---- OpenAI MRCR v2 8-needle 16K-32K 96.5%97.2%---- OpenAI MRCR v2 8-needle 32K-64K 90.0%90.5%---- OpenAI MRCR v2 8-needle 64K-128K 83.1%86.0%---- OpenAI MRCR v2 8-needle 128K-256K 87.5%79.3%--59.2%- OpenAI MRCR v2 8-needle 256K-512K 81.5%57.5%---- OpenAI MRCR v2 8-needle 512K-1M 74.0%36.6%--32.2%-
抽象推理
EvalGPT-5.5GPT-5.4GPT-5.5 ProGPT-5.4 ProClaude Opus 4.7Gemini 3.1 Pro ARC-AGI-1 (已验证)95.0%93.7%-94.5%93.5%98.0% ARC-AGI-2 (已验证)85.0%73.3%-83.3%75.8%77.1%
GPT 的评估在推理努力程度设置为极高(xhigh)的研究环境下运行,这可能在部分情况下与生产环境中的 ChatGPT 输出略有差异。