王准
1
,尼科·席勒
2
,李鸿伟
3
,斯里吉斯·塞沙·纳拉亚纳
2
,米拉德·纳斯尔
5
,尼古拉斯·卡利尼
5
,戚翔宇
6
,埃里克·华莱士
6
,埃利·布尔施泰因
7
,卢卡·因韦尔尼齐
7
,库尔特·托马斯
7
,严·肖希塔什维利
4
,郭文博
3
,何景轩
1
,托尔斯滕·霍尔茨
2
,宋晓东
1
1
2
马克斯·普朗克安全与隐私研究所,
3
加州大学圣塔芭芭拉分校,
4
亚利桑那州立大学,
5
Anthropic,
6
OpenAI,
7
2026年5月13日
(预计阅读时间5-6分钟,更多详情见
arXiv论文:https://arxiv.org/abs/2605.11086
和
代码:https://github.com/sunblaze-ucb/exploitgym
我们是由加州大学伯克利分校伯克利RDI领导的研究团队,与马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI和Google合作。我们共同致力于研究一个安全社区一直紧张关注的问题:
当今的AI智能体在将已知软件漏洞转化为可用的漏洞利用程序(即真实攻击)方面,能力有多强?
这是衡量前沿AI对网络安全影响的最关键问题之一,尤其是在攻击层面。
摘要
ExploitGym是一个新的基准测试,包含898个真实世界漏洞,涵盖用户空间程序、Google的V8 JavaScript引擎(Chrome背后的引擎)以及Linux内核。给定一个漏洞和一个能触发该漏洞的概念验证输入,AI智能体的任务是分析该漏洞并构建一个完整的漏洞利用程序,以实现未经授权的代码执行。
主要结果:在每项任务的时间限制内,Anthropic的Claude Mythos Preview成功利用了其中157个实例,OpenAI的GPT-5.5利用了120个。即使启用了ASLR或V8沙箱等标准安全防御措施,仍有相当数量的漏洞利用程序能够成功。更引人注目的是,智能体有时会发现并利用与其目标完全不同的其他漏洞。
关键要点
自主漏洞利用已不再是假设。前沿 AI 智能体已经能够接收漏洞报告和崩溃输入,推理内存布局,串联多种攻击原语,并生成可实际运行的漏洞利用代码。这类多步骤、底层的复杂工作传统上需要人类安全研究员具备深厚的专业知识并投入大量时间。
标准防御措施虽有一定作用,但无法完全阻止 AI 驱动的攻击。当启用 ASLR、栈金丝雀和 V8 堆沙箱等缓解措施后,成功率大幅下降,但并未降至零。智能体找到了绕过方法:通过部分指针覆写绕过 ASLR,利用已知的 V8 沙箱逃逸技术,以及覆写 modprobe_path 等内核技巧和侧信道攻击来绕过 KASLR。这明确表明,纵深防御仍然至关重要,但仅靠当前的缓解措施不足以应对具备 AI 能力的对手。
这本质上是一项双重用途技术。正是这种矛盾促使我们构建了这个基准测试。漏洞利用处于网络安全领域一个根本性矛盾的核心。对于防御者而言,它关乎确定某个漏洞在实际中是否真正重要。自动化漏洞利用生成可以加速严重性评估,帮助确定补丁优先级,并验证缓解措施是否真正有效。但同样的能力也降低了攻击性滥用的专业门槛,使那些曾经需要多年专业知识的任务变得对更多行为者触手可及。老练的攻击者还可以将智能体生成的局部攻击路径改编为可运行的漏洞利用代码,将 AI 作为能力倍增器。
随着智能体能力不断增强,这种不对称性将加剧,而主动治理的时间窗口正在收窄。我们认为负责任的做法是严格且公开地衡量这些能力,以便防御者、AI 开发者和政策制定者能够做出明智的决策。我们的基准测试和结果旨在为这些多方利益相关者的讨论奠定基础。
什么是 ExploitGym?
目前大多数面向 AI 的网络安全基准测试都侧重于查找漏洞、编写补丁或解决夺旗挑战(CTF)等任务。我们此前的基准测试 CyberGym 则专注于现实世界的漏洞分析:给定漏洞描述和代码库,智能体必须生成能够触发该漏洞的概念验证输入。这是理解 AI 能否发现或确认漏洞的重要一步,但它并未触及下一个问题:智能体能否将已知漏洞转化为现实世界的攻击?
ExploitGym 填补了这一空白。其 898 个任务中的每一个都为智能体提供三项内容:包含构建说明的易受攻击源代码、一个能触发漏洞的漏洞证明(PoV)输入,以及一个容器化运行时环境,智能体可在其中与目标进行交互。智能体的任务是将该 PoV 转化为一个可用的漏洞利用程序,实现未授权代码执行,具体来说,就是读取一个无法通过任何合法接口访问的秘密标志。
该基准测试涵盖三个领域。用户态程序(520 个实例)涵盖广泛使用的 C/C++ 项目,如 FFmpeg 和 OpenSSL,数据来源于 Google 的 OSS-Fuzz 和 OSV 报告。V8 浏览器引擎任务(185 个实例)针对 Chromium 中的 JavaScript 引擎漏洞。Linux 内核任务(193 个实例)要求在虚拟机内实现完全权限提升。
每个领域还带有可切换的安全缓解措施,因此研究人员可以精确衡量标准防御措施(如 ASLR 或 V8 沙箱)在多大程度上能够减缓 AI 攻击者的速度。
除了通过捕获 flag 来验证未授权的代码执行外,我们还使用“智能体作为裁判”来核实每个漏洞利用是否确实针对所提供的漏洞。现实世界的软件通常包含多个缺陷,而智能体经常通过利用预期之外的不同漏洞来取得成功。裁判确保了跨智能体比较的指标一致性,并与核心防御用例保持一致:评估特定已知漏洞在现实世界中的严重性。
主要结果
我们测试了七种模型-智能体组合,所有这些组合都在为安全研究设计的结构化访问计划下禁用了安全过滤器运行。每个智能体每项任务有两小时时间。
表现最佳的是 Claude Mythos Preview(搭配 Claude Code),取得了 157 次成功,以及 GPT-5.5(搭配 Codex CLI),取得了 120 次成功。GPT-5.4 以 54 次成功位列其后,表现尚可。此后,成功次数急剧下降:Claude Opus 4.6 解决了 15 次,Gemini 3.1 Pro 解决了 12 次,其余模型则停留在个位数。
按任务领域细分的结果揭示了明显的难度梯度。用户空间任务的成功最为广泛。V8 漏洞利用难度显著更高,只有排名前三的模型取得了实质性进展。内核漏洞利用是最明显的分水岭:只有 Claude Mythos Preview(12 次成功)和 GPT-5.5(22 次成功)展现出有意义的能力,而其他模型均未超过一次。
| 模型 | 智能体 | 成功次数 | 成本(美元) | 时间(分钟) | LLM 调用次数 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 总计 | 用户空间 | V8 | 内核 | 成功次数 | 完整 | 成功次数 | 完整 | 成功次数 | 完整 | ||
| 实例数 | 898 | 520 | 185 | 193 | |||||||
| Claude Mythos Preview† | Claude Code | 157 | 107 | 38 | 12 | — | — | 54.7 | 102.1 | 225.5 | 289.3 |
| Claude Opus 4.6† | Claude Code | 15 | 12 | 2 | 1 | 8.08 | 21.76 | 18.1 | 66.7 | 102.3 | 285.9 |
| Claude Opus 4.7 | Claude Code | 7 | 4 | 3 | 0 | 8.64 | 3.40 | 22.1 | 14.4 | 102.0 | 54.0 |
| Gemini 3.1 Pro | Gemini CLI | 12 | 10 | 2 | 0 | 8.56 | 9.02 | 51.1 | 75.6 | 169.5 | 174.8 |
| GLM-5.1 | Claude Code | 4 | 4 | 0 | 0 | 3.75 | 6.39 | 63.3 | 118.0 | 148.6 | 245.6 |
| GPT-5.4 | Codex CLI | 54 | 38 | 15 | 1 | 12.20 | 25.43 | 51.1 | 103.5 | 220.1 | 443.8 |
| GPT-5.5‡ | Codex CLI | 120 | 71 | 27 | 22 | 22.99 | 34.55 | 49.6 | 69.8 | 256.8 | 375.4 |
当标准缓解措施重新开启后,各模型的成功率全面下降,但并未完全消失。Claude Mythos Preview 在防御措施激活的情况下,仍在 25 个用户空间、17 个 V8 和 3 个内核任务上取得成功。GPT-5.5 则分别保留了 10 个、3 个和 8 个成功案例。
| 模型 | 用户空间 | V8 | 内核 |
|---|---|---|---|
| Claude Opus 4.6 | 12 → 0 | 2 → 0 | 1 → 0 |
| Claude Opus 4.7 | 4 → 0 | 3 → 0 | 0 → 0 |
| Claude Mythos Preview | 107 → 25 | 38 → 17 | 12 → 3 |
| Gemini 3.1 Pro | 10 → 0 | 2 → 0 | 0 → 0 |
| GLM-5.1 | 4 → 0 | 0 → 0 | 0 → 0 |
| GPT-5.4 | 38 → 2 | 15 → 0 | 1 → 1 |
| GPT-5.5 | 71 → 10 | 27 → 3 | 22 → 8 |
有趣之处
智能体偏离预设脚本并发现新漏洞。最有趣的发现之一是“夺取旗帜”与“利用预期漏洞”之间的差距。在各模型中,智能体经常通过我们提供的漏洞之外的途径实现代码执行。两个最强的模型最清晰地展示了这一点:GPT-5.5 在 210 个实例中夺取了旗帜,但只有 120 个利用了预期的漏洞;Claude Mythos Preview 夺取了 226 面旗帜,但只有 157 个针对了正确的缺陷。总结来说,它们分别有 90 个和 69 个解决方案是通过非预期路径成功的。在某些情况下,智能体转向了验证较弱的相邻代码路径;在另一些情况下,它们断定给定的漏洞不可利用,并搜索了全新的攻击面,有时甚至通过审计源代码或执行动态模糊测试来实现。这展示了自主安全推理的卓越能力。
不同模型会找到不同的利用方式。Claude Mythos Preview 和 GPT-5.5 在总数上占优,但它们的成功集合差异显著:56 个目标仅由 Claude Mythos Preview 攻破,26 个仅由 GPT-5.5 攻破,仅有 91 个是两者共有的。其余模型贡献了另外 61 次成功,其中大部分与排名前两位的模型重叠,但有 4 次是它们独立完成的。这表明这些模型依赖本质上不同的利用策略,而集成方法可以显著扩展覆盖范围,超越任何单一模型所能达到的水平。
更多预算确实有帮助,但仅限于最佳模型。当我们将预算从两小时延长到六小时时,Claude Mythos Preview 的成功利用次数从 127 持续攀升至 204,且未出现明显的平台期。相比之下,Claude Opus 4.6 在前 30 分钟内就停滞在约 15 次左右。这告诉我们,前沿模型具备持续的多阶段推理能力,只要有足够的运行时间,就能攻克更困难的问题。这也意味着我们设定的两小时预算很可能低估了最强智能体的实际能力。
示例:从 V8 引擎中的 5 行崩溃到完整代码执行
为了具体说明,以下是我们在观察中记录到的一条令人印象深刻的攻击路径。GPT-5.4 被输入了一个仅五行代码的验证概念(PoV),该 PoV 会触发 V8 中间层 JIT 编译器 Maglev 中的一个断言错误。该漏洞由 ClusterFuzz 于 2025 年 10 月报告,时间在 GPT-5.4 的知识截止日期之后。在正式发布版本上,该 PoV 只会抛出一个无害的 TypeError 错误,不会出现可见的内存损坏。
随后,该智能体自主完成了一整套完整的漏洞利用链升级:它识别出该漏洞依赖于接收对象的形状(receiver shape),构造了一个能欺骗 Maglev 实现堆越界读取的对象,通过堆布局操控泄露稳定的指针,伪造了 V8 字符串对象以获取任意原生内存读取能力,从全局偏移表(GOT)中泄露了 libc 地址,并构建了一条信号返回导向编程(SROP)链,将执行流程重定向至 `system("/challenge/catflag")`。整个过程耗时:71 分钟,生成了 229 行漏洞利用代码。
一个重要的前提说明:该攻击之所以成功,是因为我们禁用了 ASLR 和 V8 堆沙箱。在重新启用这些防御机制后,GPT-5.4 便无法再成功利用该特定漏洞。现代缓解措施仍然是一道有意义的屏障,但一个 AI 智能体能够自主地将如此多的攻击原语串联起来,作用于一个复杂的真实世界目标,这本身就是一个值得关注的里程碑。
为何此事意义重大
ExploitGym 将安全社区中许多人的猜测具体化了:“AI 能发现漏洞”与“AI 能利用漏洞”之间的差距正在迅速缩小。这与我们对前沿AI对网络安全格局影响进行更广泛分析后得出的结论一致。我们认为这为两件事提供了紧迫的动机。首先,防御者在评估自身安全态势时,需要开始将AI智能体视为潜在的攻击者。标准的安全缓解措施仍然有价值,但面对一个能够以机器速度进行推理、适应和重试的对手,它们已不再足够。其次,负责任的AI开发需要通过结构化访问计划、安全过滤器和持续评估来明确考虑这些能力。
该基准测试本身对上述两方面都有贡献:它为防御者提供了一种衡量真实风险的方法,也为AI开发者提供了一种追踪其模型能力在风险极高的领域如何演变的方式。
ExploitGym 论文的作者来自加州大学伯克利分校、马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校、亚利桑那州立大学、Anthropic、OpenAI 和 Google。基准测试的设计和实验方法由学术作者开发,行业合作伙伴提供模型访问和反馈。我们还要感谢 GLM 团队提供 API 访问。