Berkeley RDI:Blog(AI 安全与评测)
精选
79AI 编辑部评分,满分 100

ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?

2026-05-13 00:00· 91天前
AI 导读

由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。

推荐理由

顶级 AI 模型已能自己把已知软件漏洞变成可运行攻击代码,连 ASLR 等标准防御都挡不住部分攻击,研究更发现模型会主动寻找更危险的意外漏洞。安全行业不能再把这当成假设性问题了。

正文 · AI 翻译

王准

1

,尼科·席勒

2

,李鸿伟

3

,斯里吉斯·塞沙·纳拉亚纳

2

,米拉德·纳斯尔

5

,尼古拉斯·卡利尼

5

,戚翔宇

6

,埃里克·华莱士

6

,埃利·布尔施泰因

7

,卢卡·因韦尔尼齐

7

,库尔特·托马斯

7

,严·肖希塔什维利

4

,郭文博

3

,何景轩

1

,托尔斯滕·霍尔茨

2

,宋晓东

1

1

2

马克斯·普朗克安全与隐私研究所,

3

加州大学圣塔芭芭拉分校,

4

亚利桑那州立大学,

5

Anthropic,

6

OpenAI,

7

Google

2026年5月13日

(预计阅读时间5-6分钟,更多详情见

arXiv论文:https://arxiv.org/abs/2605.11086

代码:https://github.com/sunblaze-ucb/exploitgym

我们是由加州大学伯克利分校伯克利RDI领导的研究团队,与马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI和Google合作。我们共同致力于研究一个安全社区一直紧张关注的问题:

当今的AI智能体在将已知软件漏洞转化为可用的漏洞利用程序(即真实攻击)方面,能力有多强?

这是衡量前沿AI对网络安全影响的最关键问题之一,尤其是在攻击层面。

摘要

ExploitGym是一个新的基准测试,包含898个真实世界漏洞,涵盖用户空间程序、Google的V8 JavaScript引擎(Chrome背后的引擎)以及Linux内核。给定一个漏洞和一个能触发该漏洞的概念验证输入,AI智能体的任务是分析该漏洞并构建一个完整的漏洞利用程序,以实现未经授权的代码执行。

主要结果:在每项任务的时间限制内,Anthropic的Claude Mythos Preview成功利用了其中157个实例,OpenAI的GPT-5.5利用了120个。即使启用了ASLR或V8沙箱等标准安全防御措施,仍有相当数量的漏洞利用程序能够成功。更引人注目的是,智能体有时会发现并利用与其目标完全不同的其他漏洞。

关键要点

自主漏洞利用已不再是假设。前沿 AI 智能体已经能够接收漏洞报告和崩溃输入,推理内存布局,串联多种攻击原语,并生成可实际运行的漏洞利用代码。这类多步骤、底层的复杂工作传统上需要人类安全研究员具备深厚的专业知识并投入大量时间。

标准防御措施虽有一定作用,但无法完全阻止 AI 驱动的攻击。当启用 ASLR、栈金丝雀和 V8 堆沙箱等缓解措施后,成功率大幅下降,但并未降至零。智能体找到了绕过方法:通过部分指针覆写绕过 ASLR,利用已知的 V8 沙箱逃逸技术,以及覆写 modprobe_path 等内核技巧和侧信道攻击来绕过 KASLR。这明确表明,纵深防御仍然至关重要,但仅靠当前的缓解措施不足以应对具备 AI 能力的对手。

这本质上是一项双重用途技术。正是这种矛盾促使我们构建了这个基准测试。漏洞利用处于网络安全领域一个根本性矛盾的核心。对于防御者而言,它关乎确定某个漏洞在实际中是否真正重要。自动化漏洞利用生成可以加速严重性评估,帮助确定补丁优先级,并验证缓解措施是否真正有效。但同样的能力也降低了攻击性滥用的专业门槛,使那些曾经需要多年专业知识的任务变得对更多行为者触手可及。老练的攻击者还可以将智能体生成的局部攻击路径改编为可运行的漏洞利用代码,将 AI 作为能力倍增器。

随着智能体能力不断增强,这种不对称性将加剧,而主动治理的时间窗口正在收窄。我们认为负责任的做法是严格且公开地衡量这些能力,以便防御者、AI 开发者和政策制定者能够做出明智的决策。我们的基准测试和结果旨在为这些多方利益相关者的讨论奠定基础。

什么是 ExploitGym?

目前大多数面向 AI 的网络安全基准测试都侧重于查找漏洞、编写补丁或解决夺旗挑战(CTF)等任务。我们此前的基准测试 CyberGym 则专注于现实世界的漏洞分析:给定漏洞描述和代码库,智能体必须生成能够触发该漏洞的概念验证输入。这是理解 AI 能否发现或确认漏洞的重要一步,但它并未触及下一个问题:智能体能否将已知漏洞转化为现实世界的攻击?

ExploitGym 填补了这一空白。其 898 个任务中的每一个都为智能体提供三项内容:包含构建说明的易受攻击源代码、一个能触发漏洞的漏洞证明(PoV)输入,以及一个容器化运行时环境,智能体可在其中与目标进行交互。智能体的任务是将该 PoV 转化为一个可用的漏洞利用程序,实现未授权代码执行,具体来说,就是读取一个无法通过任何合法接口访问的秘密标志。

Overview of ExploitGym
图 1:ExploitGym 概览。每个任务向智能体提供易受攻击的源代码、一个漏洞证明(PoV)输入以及一个容器化运行时;智能体必须生成一个漏洞利用程序,实现未授权代码执行并读取秘密标志。这 898 个任务涵盖三个领域(用户态程序、V8 引擎和 Linux 内核),每个领域都带有可切换的安全缓解措施。

该基准测试涵盖三个领域。用户态程序(520 个实例)涵盖广泛使用的 C/C++ 项目,如 FFmpeg 和 OpenSSL,数据来源于 Google 的 OSS-Fuzz 和 OSV 报告。V8 浏览器引擎任务(185 个实例)针对 Chromium 中的 JavaScript 引擎漏洞。Linux 内核任务(193 个实例)要求在虚拟机内实现完全权限提升。

每个领域还带有可切换的安全缓解措施,因此研究人员可以精确衡量标准防御措施(如 ASLR 或 V8 沙箱)在多大程度上能够减缓 AI 攻击者的速度。

除了通过捕获 flag 来验证未授权的代码执行外,我们还使用“智能体作为裁判”来核实每个漏洞利用是否确实针对所提供的漏洞。现实世界的软件通常包含多个缺陷,而智能体经常通过利用预期之外的不同漏洞来取得成功。裁判确保了跨智能体比较的指标一致性,并与核心防御用例保持一致:评估特定已知漏洞在现实世界中的严重性。

主要结果

我们测试了七种模型-智能体组合,所有这些组合都在为安全研究设计的结构化访问计划下禁用了安全过滤器运行。每个智能体每项任务有两小时时间。

表现最佳的是 Claude Mythos Preview(搭配 Claude Code),取得了 157 次成功,以及 GPT-5.5(搭配 Codex CLI),取得了 120 次成功。GPT-5.4 以 54 次成功位列其后,表现尚可。此后,成功次数急剧下降:Claude Opus 4.6 解决了 15 次,Gemini 3.1 Pro 解决了 12 次,其余模型则停留在个位数。

按任务领域细分的结果揭示了明显的难度梯度。用户空间任务的成功最为广泛。V8 漏洞利用难度显著更高,只有排名前三的模型取得了实质性进展。内核漏洞利用是最明显的分水岭:只有 Claude Mythos Preview(12 次成功)和 GPT-5.5(22 次成功)展现出有意义的能力,而其他模型均未超过一次。

媒体内容 · 前往原文查看
图 2:按模型划分的成功漏洞利用次数,按领域(用户空间、V8、内核)细分。Claude Mythos Preview 和 GPT-5.5 以巨大优势领先;内核漏洞利用尤其成为前沿模型与非前沿模型之间的明显分水岭。并且前沿智能体 AI 能够绕过标准缓解措施(例如 K/ASLR、栈金丝雀、V8 堆沙箱)。
媒体内容 · 前往原文查看
模型 智能体 成功次数 成本(美元) 时间(分钟) LLM 调用次数
总计 用户空间 V8 内核 成功次数 完整 成功次数 完整 成功次数 完整
实例数 898 520 185 193
Claude Mythos Preview† Claude Code 157 107 38 12 54.7 102.1 225.5 289.3
Claude Opus 4.6† Claude Code 15 12 2 1 8.08 21.76 18.1 66.7 102.3 285.9
Claude Opus 4.7 Claude Code 7 4 3 0 8.64 3.40 22.1 14.4 102.0 54.0
Gemini 3.1 Pro Gemini CLI 12 10 2 0 8.56 9.02 51.1 75.6 169.5 174.8
GLM-5.1 Claude Code 4 4 0 0 3.75 6.39 63.3 118.0 148.6 245.6
GPT-5.4 Codex CLI 54 38 15 1 12.20 25.43 51.1 103.5 220.1 443.8
GPT-5.5‡ Codex CLI 120 71 27 22 22.99 34.55 49.6 69.8 256.8 375.4
表 1:两小时超时条件下的智能体性能。成功次数按领域划分:用户空间(U)、V8(B)和内核(K)。成本、时间和 LLM 调用次数为成功运行(Succ.)和完整基准测试(Full)中每个任务的平均值。† 结果是与 Anthropic 合作获得的。‡ OpenAI 的默认安全过滤器在默认提示词下阻止了所有 GPT-5.5 的漏洞利用尝试。

当标准缓解措施重新开启后,各模型的成功率全面下降,但并未完全消失。Claude Mythos Preview 在防御措施激活的情况下,仍在 25 个用户空间、17 个 V8 和 3 个内核任务上取得成功。GPT-5.5 则分别保留了 10 个、3 个和 8 个成功案例。

媒体内容 · 前往原文查看
模型 用户空间 V8 内核
Claude Opus 4.6 12 → 0 2 → 0 1 → 0
Claude Opus 4.7 4 → 0 3 → 0 0 → 0
Claude Mythos Preview 107 → 25 38 → 17 12 → 3
Gemini 3.1 Pro 10 → 0 2 → 0 0 → 0
GLM-5.1 4 → 0 0 → 0 0 → 0
GPT-5.4 38 → 2 15 → 0 1 → 1
GPT-5.5 71 → 10 27 → 3 22 → 8
表 2:绕过缓解措施的漏洞利用。每个单元格显示无缓解措施时的成功次数 → 启用缓解措施后的成功次数(包括 ASLR、栈金丝雀、V8 堆沙箱、KASLR 等)。

有趣之处

智能体偏离预设脚本并发现新漏洞。最有趣的发现之一是“夺取旗帜”与“利用预期漏洞”之间的差距。在各模型中,智能体经常通过我们提供的漏洞之外的途径实现代码执行。两个最强的模型最清晰地展示了这一点:GPT-5.5 在 210 个实例中夺取了旗帜,但只有 120 个利用了预期的漏洞;Claude Mythos Preview 夺取了 226 面旗帜,但只有 157 个针对了正确的缺陷。总结来说,它们分别有 90 个和 69 个解决方案是通过非预期路径成功的。在某些情况下,智能体转向了验证较弱的相邻代码路径;在另一些情况下,它们断定给定的漏洞不可利用,并搜索了全新的攻击面,有时甚至通过审计源代码或执行动态模糊测试来实现。这展示了自主安全推理的卓越能力。

媒体内容 · 前往原文查看
图3:按模型细分智能体实现未授权代码执行的实例。每个柱状图叠加了针对目标漏洞的成功利用(深蓝色),以及通过不同漏洞实现的非预期利用(浅蓝色)。缺口部分(例如 Claude Mythos Preview 的 226 → 157,GPT-5.5 的 210 → 120)表明智能体会偏离预设脚本,转而利用与其被指向目标不同的漏洞。

不同模型会找到不同的利用方式。Claude Mythos Preview 和 GPT-5.5 在总数上占优,但它们的成功集合差异显著:56 个目标仅由 Claude Mythos Preview 攻破,26 个仅由 GPT-5.5 攻破,仅有 91 个是两者共有的。其余模型贡献了另外 61 次成功,其中大部分与排名前两位的模型重叠,但有 4 次是它们独立完成的。这表明这些模型依赖本质上不同的利用策略,而集成方法可以显著扩展覆盖范围,超越任何单一模型所能达到的水平。

Venn diagram of successes across models
图4:各模型成功利用实例的重叠情况。56 个目标仅由 Claude Mythos Preview 攻破,26 个仅由 GPT-5.5 攻破,两者共有 91 个;其余模型贡献了 4 个由它们独立完成的实例。

更多预算确实有帮助,但仅限于最佳模型。当我们将预算从两小时延长到六小时时,Claude Mythos Preview 的成功利用次数从 127 持续攀升至 204,且未出现明显的平台期。相比之下,Claude Opus 4.6 在前 30 分钟内就停滞在约 15 次左右。这告诉我们,前沿模型具备持续的多阶段推理能力,只要有足够的运行时间,就能攻克更困难的问题。这也意味着我们设定的两小时预算很可能低估了最强智能体的实际能力。

Cumulative successes vs. time budget
图5:随着每项任务的时间预算从几分钟增加到六小时,累计成功利用次数。Claude Mythos Preview 从 127 次(2 小时)持续攀升至 204 次(6 小时),未出现明显平台期,而 Claude Opus 4.6 在前半小时内就停滞不前。前沿智能体只要有足够的运行时间,就能维持多阶段推理,因此两小时的预算很可能低估了最强智能体的实际能力。

示例:从 V8 引擎中的 5 行崩溃到完整代码执行

为了具体说明,以下是我们在观察中记录到的一条令人印象深刻的攻击路径。GPT-5.4 被输入了一个仅五行代码的验证概念(PoV),该 PoV 会触发 V8 中间层 JIT 编译器 Maglev 中的一个断言错误。该漏洞由 ClusterFuzz 于 2025 年 10 月报告,时间在 GPT-5.4 的知识截止日期之后。在正式发布版本上,该 PoV 只会抛出一个无害的 TypeError 错误,不会出现可见的内存损坏。

随后,该智能体自主完成了一整套完整的漏洞利用链升级:它识别出该漏洞依赖于接收对象的形状(receiver shape),构造了一个能欺骗 Maglev 实现堆越界读取的对象,通过堆布局操控泄露稳定的指针,伪造了 V8 字符串对象以获取任意原生内存读取能力,从全局偏移表(GOT)中泄露了 libc 地址,并构建了一条信号返回导向编程(SROP)链,将执行流程重定向至 `system("/challenge/catflag")`。整个过程耗时:71 分钟,生成了 229 行漏洞利用代码。

一个重要的前提说明:该攻击之所以成功,是因为我们禁用了 ASLR 和 V8 堆沙箱。在重新启用这些防御机制后,GPT-5.4 便无法再成功利用该特定漏洞。现代缓解措施仍然是一道有意义的屏障,但一个 AI 智能体能够自主地将如此多的攻击原语串联起来,作用于一个复杂的真实世界目标,这本身就是一个值得关注的里程碑。

GPT-5.4 V8 exploit chain trajectory
图 6:GPT-5.4 的 V8 漏洞利用链。从一个在正式发布版本上仅触发 TypeError 错误的五行 PoV 开始,该智能体依次完成了:越界堆读取 → 指针泄露 → 伪造字符串 → 任意读取 → libc 泄露 → SROP 链,最终执行 `system("/challenge/catflag")`。耗时:71 分钟,229 行漏洞利用代码(在禁用 ASLR 和 V8 堆沙箱的条件下)。

为何此事意义重大

ExploitGym 将安全社区中许多人的猜测具体化了:“AI 能发现漏洞”与“AI 能利用漏洞”之间的差距正在迅速缩小。这与我们对前沿AI对网络安全格局影响进行更广泛分析后得出的结论一致。我们认为这为两件事提供了紧迫的动机。首先,防御者在评估自身安全态势时,需要开始将AI智能体视为潜在的攻击者。标准的安全缓解措施仍然有价值,但面对一个能够以机器速度进行推理、适应和重试的对手,它们已不再足够。其次,负责任的AI开发需要通过结构化访问计划、安全过滤器和持续评估来明确考虑这些能力。

该基准测试本身对上述两方面都有贡献:它为防御者提供了一种衡量真实风险的方法,也为AI开发者提供了一种追踪其模型能力在风险极高的领域如何演变的方式。


ExploitGym 论文的作者来自加州大学伯克利分校、马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI 和 Google。基准测试的设计和实验方法由学术作者开发,行业合作伙伴提供模型访问和反馈。我们还要感谢 GLM 团队提供 API 访问。

来源:Berkeley RDI:Blog(AI 安全与评测) · rdi.berkeley.edu

事件后续 · 2查看事件全部 →

ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?

Berkeley RDI:Blog(AI 安全与评测)·2026-05-13 00:00·91天前
AI 导读

由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。

正文 · AI 翻译

王准

1

,尼科·席勒

2

,李鸿伟

3

,斯里吉斯·塞沙·纳拉亚纳

2

,米拉德·纳斯尔

5

,尼古拉斯·卡利尼

5

,戚翔宇

6

,埃里克·华莱士

6

,埃利·布尔施泰因

7

,卢卡·因韦尔尼齐

7

,库尔特·托马斯

7

,严·肖希塔什维利

4

,郭文博

3

,何景轩

1

,托尔斯滕·霍尔茨

2

,宋晓东

1

1

2

马克斯·普朗克安全与隐私研究所,

3

加州大学圣塔芭芭拉分校,

4

亚利桑那州立大学,

5

Anthropic,

6

OpenAI,

7

Google

2026年5月13日

(预计阅读时间5-6分钟,更多详情见

arXiv论文:https://arxiv.org/abs/2605.11086

代码:https://github.com/sunblaze-ucb/exploitgym

我们是由加州大学伯克利分校伯克利RDI领导的研究团队,与马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI和Google合作。我们共同致力于研究一个安全社区一直紧张关注的问题:

当今的AI智能体在将已知软件漏洞转化为可用的漏洞利用程序(即真实攻击)方面,能力有多强?

这是衡量前沿AI对网络安全影响的最关键问题之一,尤其是在攻击层面。

摘要

ExploitGym是一个新的基准测试,包含898个真实世界漏洞,涵盖用户空间程序、Google的V8 JavaScript引擎(Chrome背后的引擎)以及Linux内核。给定一个漏洞和一个能触发该漏洞的概念验证输入,AI智能体的任务是分析该漏洞并构建一个完整的漏洞利用程序,以实现未经授权的代码执行。

主要结果:在每项任务的时间限制内,Anthropic的Claude Mythos Preview成功利用了其中157个实例,OpenAI的GPT-5.5利用了120个。即使启用了ASLR或V8沙箱等标准安全防御措施,仍有相当数量的漏洞利用程序能够成功。更引人注目的是,智能体有时会发现并利用与其目标完全不同的其他漏洞。

关键要点

自主漏洞利用已不再是假设。前沿 AI 智能体已经能够接收漏洞报告和崩溃输入,推理内存布局,串联多种攻击原语,并生成可实际运行的漏洞利用代码。这类多步骤、底层的复杂工作传统上需要人类安全研究员具备深厚的专业知识并投入大量时间。

标准防御措施虽有一定作用,但无法完全阻止 AI 驱动的攻击。当启用 ASLR、栈金丝雀和 V8 堆沙箱等缓解措施后,成功率大幅下降,但并未降至零。智能体找到了绕过方法:通过部分指针覆写绕过 ASLR,利用已知的 V8 沙箱逃逸技术,以及覆写 modprobe_path 等内核技巧和侧信道攻击来绕过 KASLR。这明确表明,纵深防御仍然至关重要,但仅靠当前的缓解措施不足以应对具备 AI 能力的对手。

这本质上是一项双重用途技术。正是这种矛盾促使我们构建了这个基准测试。漏洞利用处于网络安全领域一个根本性矛盾的核心。对于防御者而言,它关乎确定某个漏洞在实际中是否真正重要。自动化漏洞利用生成可以加速严重性评估,帮助确定补丁优先级,并验证缓解措施是否真正有效。但同样的能力也降低了攻击性滥用的专业门槛,使那些曾经需要多年专业知识的任务变得对更多行为者触手可及。老练的攻击者还可以将智能体生成的局部攻击路径改编为可运行的漏洞利用代码,将 AI 作为能力倍增器。

随着智能体能力不断增强,这种不对称性将加剧,而主动治理的时间窗口正在收窄。我们认为负责任的做法是严格且公开地衡量这些能力,以便防御者、AI 开发者和政策制定者能够做出明智的决策。我们的基准测试和结果旨在为这些多方利益相关者的讨论奠定基础。

什么是 ExploitGym?

目前大多数面向 AI 的网络安全基准测试都侧重于查找漏洞、编写补丁或解决夺旗挑战(CTF)等任务。我们此前的基准测试 CyberGym 则专注于现实世界的漏洞分析:给定漏洞描述和代码库,智能体必须生成能够触发该漏洞的概念验证输入。这是理解 AI 能否发现或确认漏洞的重要一步,但它并未触及下一个问题:智能体能否将已知漏洞转化为现实世界的攻击?

ExploitGym 填补了这一空白。其 898 个任务中的每一个都为智能体提供三项内容:包含构建说明的易受攻击源代码、一个能触发漏洞的漏洞证明(PoV)输入,以及一个容器化运行时环境,智能体可在其中与目标进行交互。智能体的任务是将该 PoV 转化为一个可用的漏洞利用程序,实现未授权代码执行,具体来说,就是读取一个无法通过任何合法接口访问的秘密标志。

Overview of ExploitGym
图 1:ExploitGym 概览。每个任务向智能体提供易受攻击的源代码、一个漏洞证明(PoV)输入以及一个容器化运行时;智能体必须生成一个漏洞利用程序,实现未授权代码执行并读取秘密标志。这 898 个任务涵盖三个领域(用户态程序、V8 引擎和 Linux 内核),每个领域都带有可切换的安全缓解措施。

该基准测试涵盖三个领域。用户态程序(520 个实例)涵盖广泛使用的 C/C++ 项目,如 FFmpeg 和 OpenSSL,数据来源于 Google 的 OSS-Fuzz 和 OSV 报告。V8 浏览器引擎任务(185 个实例)针对 Chromium 中的 JavaScript 引擎漏洞。Linux 内核任务(193 个实例)要求在虚拟机内实现完全权限提升。

每个领域还带有可切换的安全缓解措施,因此研究人员可以精确衡量标准防御措施(如 ASLR 或 V8 沙箱)在多大程度上能够减缓 AI 攻击者的速度。

除了通过捕获 flag 来验证未授权的代码执行外,我们还使用“智能体作为裁判”来核实每个漏洞利用是否确实针对所提供的漏洞。现实世界的软件通常包含多个缺陷,而智能体经常通过利用预期之外的不同漏洞来取得成功。裁判确保了跨智能体比较的指标一致性,并与核心防御用例保持一致:评估特定已知漏洞在现实世界中的严重性。

主要结果

我们测试了七种模型-智能体组合,所有这些组合都在为安全研究设计的结构化访问计划下禁用了安全过滤器运行。每个智能体每项任务有两小时时间。

表现最佳的是 Claude Mythos Preview(搭配 Claude Code),取得了 157 次成功,以及 GPT-5.5(搭配 Codex CLI),取得了 120 次成功。GPT-5.4 以 54 次成功位列其后,表现尚可。此后,成功次数急剧下降:Claude Opus 4.6 解决了 15 次,Gemini 3.1 Pro 解决了 12 次,其余模型则停留在个位数。

按任务领域细分的结果揭示了明显的难度梯度。用户空间任务的成功最为广泛。V8 漏洞利用难度显著更高,只有排名前三的模型取得了实质性进展。内核漏洞利用是最明显的分水岭:只有 Claude Mythos Preview(12 次成功)和 GPT-5.5(22 次成功)展现出有意义的能力,而其他模型均未超过一次。

媒体内容 · 前往原文查看
图 2:按模型划分的成功漏洞利用次数,按领域(用户空间、V8、内核)细分。Claude Mythos Preview 和 GPT-5.5 以巨大优势领先;内核漏洞利用尤其成为前沿模型与非前沿模型之间的明显分水岭。并且前沿智能体 AI 能够绕过标准缓解措施(例如 K/ASLR、栈金丝雀、V8 堆沙箱)。
媒体内容 · 前往原文查看
模型 智能体 成功次数 成本(美元) 时间(分钟) LLM 调用次数
总计 用户空间 V8 内核 成功次数 完整 成功次数 完整 成功次数 完整
实例数 898 520 185 193
Claude Mythos Preview† Claude Code 157 107 38 12 54.7 102.1 225.5 289.3
Claude Opus 4.6† Claude Code 15 12 2 1 8.08 21.76 18.1 66.7 102.3 285.9
Claude Opus 4.7 Claude Code 7 4 3 0 8.64 3.40 22.1 14.4 102.0 54.0
Gemini 3.1 Pro Gemini CLI 12 10 2 0 8.56 9.02 51.1 75.6 169.5 174.8
GLM-5.1 Claude Code 4 4 0 0 3.75 6.39 63.3 118.0 148.6 245.6
GPT-5.4 Codex CLI 54 38 15 1 12.20 25.43 51.1 103.5 220.1 443.8
GPT-5.5‡ Codex CLI 120 71 27 22 22.99 34.55 49.6 69.8 256.8 375.4
表 1:两小时超时条件下的智能体性能。成功次数按领域划分:用户空间(U)、V8(B)和内核(K)。成本、时间和 LLM 调用次数为成功运行(Succ.)和完整基准测试(Full)中每个任务的平均值。† 结果是与 Anthropic 合作获得的。‡ OpenAI 的默认安全过滤器在默认提示词下阻止了所有 GPT-5.5 的漏洞利用尝试。

当标准缓解措施重新开启后,各模型的成功率全面下降,但并未完全消失。Claude Mythos Preview 在防御措施激活的情况下,仍在 25 个用户空间、17 个 V8 和 3 个内核任务上取得成功。GPT-5.5 则分别保留了 10 个、3 个和 8 个成功案例。

媒体内容 · 前往原文查看
模型 用户空间 V8 内核
Claude Opus 4.6 12 → 0 2 → 0 1 → 0
Claude Opus 4.7 4 → 0 3 → 0 0 → 0
Claude Mythos Preview 107 → 25 38 → 17 12 → 3
Gemini 3.1 Pro 10 → 0 2 → 0 0 → 0
GLM-5.1 4 → 0 0 → 0 0 → 0
GPT-5.4 38 → 2 15 → 0 1 → 1
GPT-5.5 71 → 10 27 → 3 22 → 8
表 2:绕过缓解措施的漏洞利用。每个单元格显示无缓解措施时的成功次数 → 启用缓解措施后的成功次数(包括 ASLR、栈金丝雀、V8 堆沙箱、KASLR 等)。

有趣之处

智能体偏离预设脚本并发现新漏洞。最有趣的发现之一是“夺取旗帜”与“利用预期漏洞”之间的差距。在各模型中,智能体经常通过我们提供的漏洞之外的途径实现代码执行。两个最强的模型最清晰地展示了这一点:GPT-5.5 在 210 个实例中夺取了旗帜,但只有 120 个利用了预期的漏洞;Claude Mythos Preview 夺取了 226 面旗帜,但只有 157 个针对了正确的缺陷。总结来说,它们分别有 90 个和 69 个解决方案是通过非预期路径成功的。在某些情况下,智能体转向了验证较弱的相邻代码路径;在另一些情况下,它们断定给定的漏洞不可利用,并搜索了全新的攻击面,有时甚至通过审计源代码或执行动态模糊测试来实现。这展示了自主安全推理的卓越能力。

媒体内容 · 前往原文查看
图3:按模型细分智能体实现未授权代码执行的实例。每个柱状图叠加了针对目标漏洞的成功利用(深蓝色),以及通过不同漏洞实现的非预期利用(浅蓝色)。缺口部分(例如 Claude Mythos Preview 的 226 → 157,GPT-5.5 的 210 → 120)表明智能体会偏离预设脚本,转而利用与其被指向目标不同的漏洞。

不同模型会找到不同的利用方式。Claude Mythos Preview 和 GPT-5.5 在总数上占优,但它们的成功集合差异显著:56 个目标仅由 Claude Mythos Preview 攻破,26 个仅由 GPT-5.5 攻破,仅有 91 个是两者共有的。其余模型贡献了另外 61 次成功,其中大部分与排名前两位的模型重叠,但有 4 次是它们独立完成的。这表明这些模型依赖本质上不同的利用策略,而集成方法可以显著扩展覆盖范围,超越任何单一模型所能达到的水平。

Venn diagram of successes across models
图4:各模型成功利用实例的重叠情况。56 个目标仅由 Claude Mythos Preview 攻破,26 个仅由 GPT-5.5 攻破,两者共有 91 个;其余模型贡献了 4 个由它们独立完成的实例。

更多预算确实有帮助,但仅限于最佳模型。当我们将预算从两小时延长到六小时时,Claude Mythos Preview 的成功利用次数从 127 持续攀升至 204,且未出现明显的平台期。相比之下,Claude Opus 4.6 在前 30 分钟内就停滞在约 15 次左右。这告诉我们,前沿模型具备持续的多阶段推理能力,只要有足够的运行时间,就能攻克更困难的问题。这也意味着我们设定的两小时预算很可能低估了最强智能体的实际能力。

Cumulative successes vs. time budget
图5:随着每项任务的时间预算从几分钟增加到六小时,累计成功利用次数。Claude Mythos Preview 从 127 次(2 小时)持续攀升至 204 次(6 小时),未出现明显平台期,而 Claude Opus 4.6 在前半小时内就停滞不前。前沿智能体只要有足够的运行时间,就能维持多阶段推理,因此两小时的预算很可能低估了最强智能体的实际能力。

示例:从 V8 引擎中的 5 行崩溃到完整代码执行

为了具体说明,以下是我们在观察中记录到的一条令人印象深刻的攻击路径。GPT-5.4 被输入了一个仅五行代码的验证概念(PoV),该 PoV 会触发 V8 中间层 JIT 编译器 Maglev 中的一个断言错误。该漏洞由 ClusterFuzz 于 2025 年 10 月报告,时间在 GPT-5.4 的知识截止日期之后。在正式发布版本上,该 PoV 只会抛出一个无害的 TypeError 错误,不会出现可见的内存损坏。

随后,该智能体自主完成了一整套完整的漏洞利用链升级:它识别出该漏洞依赖于接收对象的形状(receiver shape),构造了一个能欺骗 Maglev 实现堆越界读取的对象,通过堆布局操控泄露稳定的指针,伪造了 V8 字符串对象以获取任意原生内存读取能力,从全局偏移表(GOT)中泄露了 libc 地址,并构建了一条信号返回导向编程(SROP)链,将执行流程重定向至 `system("/challenge/catflag")`。整个过程耗时:71 分钟,生成了 229 行漏洞利用代码。

一个重要的前提说明:该攻击之所以成功,是因为我们禁用了 ASLR 和 V8 堆沙箱。在重新启用这些防御机制后,GPT-5.4 便无法再成功利用该特定漏洞。现代缓解措施仍然是一道有意义的屏障,但一个 AI 智能体能够自主地将如此多的攻击原语串联起来,作用于一个复杂的真实世界目标,这本身就是一个值得关注的里程碑。

GPT-5.4 V8 exploit chain trajectory
图 6:GPT-5.4 的 V8 漏洞利用链。从一个在正式发布版本上仅触发 TypeError 错误的五行 PoV 开始,该智能体依次完成了:越界堆读取 → 指针泄露 → 伪造字符串 → 任意读取 → libc 泄露 → SROP 链,最终执行 `system("/challenge/catflag")`。耗时:71 分钟,229 行漏洞利用代码(在禁用 ASLR 和 V8 堆沙箱的条件下)。

为何此事意义重大

ExploitGym 将安全社区中许多人的猜测具体化了:“AI 能发现漏洞”与“AI 能利用漏洞”之间的差距正在迅速缩小。这与我们对前沿AI对网络安全格局影响进行更广泛分析后得出的结论一致。我们认为这为两件事提供了紧迫的动机。首先,防御者在评估自身安全态势时,需要开始将AI智能体视为潜在的攻击者。标准的安全缓解措施仍然有价值,但面对一个能够以机器速度进行推理、适应和重试的对手,它们已不再足够。其次,负责任的AI开发需要通过结构化访问计划、安全过滤器和持续评估来明确考虑这些能力。

该基准测试本身对上述两方面都有贡献:它为防御者提供了一种衡量真实风险的方法,也为AI开发者提供了一种追踪其模型能力在风险极高的领域如何演变的方式。


ExploitGym 论文的作者来自加州大学伯克利分校、马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI 和 Google。基准测试的设计和实验方法由学术作者开发,行业合作伙伴提供模型访问和反馈。我们还要感谢 GLM 团队提供 API 访问。

来源:Berkeley RDI:Blog(AI 安全与评测)· rdi.berkeley.edu

事件后续 · 2查看事件全部 →