引言
Claude Mythos Preview 在漏洞利用开发方面的能力,相较于此前的前沿模型实现了阶跃式提升。这也是我们通过 Project Glasswing 谨慎推出该模型、而非进行公开发布的主要动因之一。Mythos Preview 能够发现复杂漏洞,但我们在内部测试中最担忧的是,它不仅能将漏洞转化为利用原语,还能将这些原语组合成完整的端到端攻击链。
当我们发布 Mythos Preview 的结果时,我们通过让模型搜索新的零日漏洞并为其构建利用代码来衡量其能力。像这样的定性评估有助于展示模型的能力——但理想情况下,我们希望能有高质量的定量基准,让我们能够精确地衡量这些能力。在我们发布 Mythos Preview 时面临的问题是,在初步测试中,现有的公开漏洞利用基准都不够困难,无法捕捉到 Mythos Preview 的能力。
然而,在过去一个月里,我们看到了两个更具挑战性的新学术基准的诞生:ExploitBench 和 ExploitGym。我们与这些基准的研究人员合作,衡量了 Mythos Preview 的性能,并在 SCONE-bench 的更新版本上运行了 Mythos Preview——SCONE-bench 是我们与 MATS 及 Anthropic Fellows 项目合作开发的、用于衡量智能合约漏洞利用的基准。在所有这三个基准上,我们发现 Mythos Preview 始终优于所有其他被评估的模型。我们相信,这进一步证明了,随着 Mythos 级别的能力变得更加普及,开发漏洞利用所需的知识和专业技能将大幅降低。
ExploitBench:V8 漏洞
ExploitBench 是一个用于研究大语言模型漏洞利用开发能力的基准测试。它由卡内基梅隆大学的 Seunghyun Lee 和 David Brumley 教授与 Bugcrowd 共同构建。这个基准测试的独特之处在于,它专注于衡量语言模型编写完整端到端漏洞利用程序的能力。此前的基准测试通常侧重于衡量语言模型编写“概念验证”的能力,以证明漏洞的存在。但概念验证仅表明某个缺陷是可复现或可触及的,并不代表攻击者能利用它实际造成危害。在 ExploitBench 中,语言模型必须基于漏洞构建利用原语,以实现新的能力,例如赋予攻击者任意代码执行(ACE)权限。
ExploitBench 将漏洞利用开发过程分解为 16 种不同的能力。每种能力都通过编程方式进行验证,从而可以对构建有效漏洞利用所需的不同中间能力进行细粒度分析。这 16 种能力被划分为五个能力层级,形成一个能力阶梯:
- T5 覆盖(到达易受攻击的代码路径);
- T4 复现(构建概念验证以触发缺陷);
- T3 目标原语(创建仅限于 V8 沙箱内的原语);
- T2 通用原语(突破沙箱,实现跨进程的读/写或信息泄露);
- T1 完全控制(劫持控制流或实现任意代码执行)。
基于这一框架,作者构建了一个 V8 基准测试,该测试使用了来自 V8 漏洞追踪器的 41 个(现已修补的)V8 JavaScript 和 WebAssembly 引擎漏洞。V8 引擎是广泛使用的基础设施,驱动着基于 Chromium 的应用(例如 Chrome、Edge、Android WebView)、Node.js 环境(服务器后端)以及 Electron 应用(例如 VS Code、Slack、Discord)。该框架的一个关键要素是针对安全防御机制进行测试:V8 沙箱将网页 JavaScript 对象所在的内存区域隔离起来,使得 V8 漏洞不会成为深入浏览器的突破口。最高评分等级意味着能够在整个 V8 进程中执行任意代码(在浏览器中,这相当于控制整个标签页)。
给定一个存在漏洞的 V8 引擎构建版本以及修复特定漏洞的补丁后,大语言模型被指示为该漏洞构建一个利用程序。随后,这些利用程序会根据全部 16 项能力自动进行评分,无需人工或大语言模型裁判。较低等级通过对比已修补构建版本的差异执行来检查;较高等级则使用 V8 内置的挑战-响应函数,这些函数会在多个随机化的堆布局上重放,因此硬编码泄露的地址无法通过。此外,对执行记录进行独立的静态扫描,作为后备手段来标记其他形式的作弊行为。
所有模型都在相同的 ExploitBench 测试框架上运行,并设有 300 次交互的预算,该框架本身有两种变体:基线版(Baseline)和提示版(Nudged)。在提示版中,测试框架会自适应地注入额外的提示词,在接近预算上限时提醒模型收尾,或者在模型过早停止时鼓励其用完交互预算。每种变体运行三次试验。Anthropic 运行了所有 Claude 模型,然后将所有结果和执行记录提供给基准测试的作者,由他们验证结果。


与我们此前在Mozilla Firefox上的发现一致,所有语言模型都能触及或触发给定的漏洞,但只有自Claude Opus 4.6以来的模型在V8沙箱内部的原语开发上取得了进展。突破V8沙箱(从T3到T2)是下一个能力断层;Mythos Preview是唯一能够稳定完成这一操作的测试模型,在超过一半的测试环境中都能做到。此外,在基线变体中,它还在近一半的环境中实现了控制流劫持(T1)。结合基线变体和引导变体,Mythos Preview在41个CVE中的21个上实现了任意代码执行(ACE),而其他模型在任一变体中均未实现哪怕1次ACE。排行榜上唯一实现ACE的其他模型,仅在41个CVE中的2个上达成,且使用了专有脚手架。
此外,作者对Mythos Preview的几次漏洞利用尝试进行了深入分析。在一个案例中,Mythos Preview能够针对漏洞CVE-2023-6702创建近乎确定性的利用方案,而公开已知的利用方案则具有概率性且不可控。由于漏洞利用的部署可能仅限于一次尝试,稳定性对于实际买卖的漏洞利用方案往往至关重要。Mythos Preview实现这一目标的方式同样令人印象深刻。ExploitBench的作者之一Seunghyun Lee写道:“我曾私下与v8CTF单日漏洞利用方案的原始作者讨论过完全相同的利用计划,但由于该方法过于复杂,我们很快便放弃了。而Mythos在没有任何关于这种特定利用技术的公开信息的情况下,干净利落地完美执行了这一方案。”
在此处阅读更多定性分析内容,并访问 exploitbench.ai 网站或预印本查看基准测试详情。
ExploitGym
ExploitGym 是第二个基准测试,旨在衡量大语言模型在广泛目标集上的漏洞利用能力。该基准由加州大学伯克利分校、马克斯·普朗克安全与隐私研究所、加州大学圣塔芭芭拉分校和亚利桑那州立大学(并得到 Anthropic、OpenAI 和 Google 安全研究人员的贡献)合作开发,是 CyberGym 漏洞复现基准测试的后续项目。
ExploitGym 的作者将其评估框架应用于 OSS-Fuzz、V8 引擎和 Linux 内核中众多项目里的 898 个现已修复的漏洞。这三类目标共同覆盖了全球最常用软件的很大一部分。
针对某个特定漏洞,大语言模型会获得构建信息(易受攻击的源代码和构建脚本)、漏洞信息(漏洞证明、漏洞描述)、运行时信息(编译后的二进制文件、启动脚本)以及一个运行着易受攻击入口点的远程目标。随后,大语言模型的任务是开发一个可用的漏洞利用程序,实现对目标的未授权代码执行,并以目标安全模型本应使其无法达到的权限级别运行代码。然后,它必须利用该提升后的权限来检索一个动态生成的标志。只有当提交了正确的标志,并且模型评判员判定该尝试利用了预期的漏洞(而非其他可能更容易利用的漏洞)时,该尝试才被标记为成功。该评估框架支持可切换的安全缓解措施,例如 V8 堆沙箱和 Linux 内核地址空间布局随机化(KASLR)。
评估的基线框架使用两小时的挂钟时间限制,安全缓解措施处于关闭状态,并且模型使用其开发者推荐的运行框架来运行,例如 Claude 模型使用 Claude Code 框架运行。所有模型都使用相同的提示词运行。Anthropic 运行了 Opus 4.6 和 Mythos Preview 的试验。


在两小时的时间窗口内,Mythos Preview 在 157 个任务上成功利用预期漏洞实现了未授权代码执行;若将不依赖预期漏洞的代码执行路径尝试也计入,其成功捕获旗帜的次数则扩展至 226 次。此前几代 Claude 模型的成功率显著较低;例如,Opus 4.6 利用预期漏洞仅取得 15 次成功,若计入通过其他漏洞取得的成功,则扩展至 36 次。从三类目标中成功次数的分布来看,Mythos Preview 在所有类别中均有提升,并且是仅有的两个被报告能够频繁开发内核漏洞的模型之一。
更多详情请参阅作者的博客或预印本。
SCONE:智能合约漏洞利用
去年,我们与 MATS 及 Anthropic 研究员项目合作,开发了智能合约漏洞利用基准(SCONE-bench),旨在研究大语言模型发现并利用智能合约漏洞的能力。对于每份智能合约,语言模型被指示识别一个漏洞,并在本地模拟中创建漏洞利用程序以窃取该合约管理的资金。性能通过成功漏洞利用所获得的(模拟)总收入来衡量。
我们运行了该基准测试的更新版本,使用了所有模型最新知识截止日期(2026年1月1日)之后报告的12个漏洞利用案例,问题来源为DefiHackLabs数据集。对于语言模型成功利用的每个智能合约,我们通过将模型获得的原生代币收入,按照真实漏洞发生当日CoinGecko API报告的历史汇率换算为美元,来计算该漏洞利用的美元价值。然后,我们汇总所有漏洞利用的总价值,并将其绘制在下方对数刻度的图表中。

我们发现,Mythos Preview在此基准测试中能够利用价值3500万美元的智能合约,比我们测试的次优模型高出1500万美元,即约75%。最新的前沿模型不仅能够更稳定地利用漏洞(对应更高的攻击成功率),还能更有效地利用特定漏洞窃取更多资金。Mythos Preview与其他模型之间的收入差距,主要源于Mythos Preview是唯一成功利用了所有测试漏洞的模型。Opus 4.7是唯一能够利用truebit漏洞的另一款模型;在8次尝试的设置下,没有其他模型能够利用makina漏洞。我们在最初的帖子中指出,根据总收入与发布时间的关系衡量,Opus 4.5之前模型的性能遵循对数线性轨迹,平均翻倍时间为1.1个月。Opus 4.5之后我们的模型继续遵循这一趋势,但翻倍时间仅为0.7个月。我们在那篇帖子中提到“我们预计翻倍趋势最终会趋于平稳”——但显然我们尚未达到这一平台期。
伴随本文,我们还在此处开源了SCONE-bench的测试工具和数据集。
结论
今年2月最强的模型在大多数防御措施禁用的情况下,也只能勉强在模拟场景中开发出漏洞利用程序,而Mythos Preview已经能够针对全球最广泛使用的软件构建完整的端到端漏洞利用方案。我们认为,Mythos级别的模型将在未来6到12个月内广泛可用。届时,此类漏洞利用开发所需的专业专长将大幅减少,并日益商品化。
随着模型能力持续增强,误判其能力的代价也随之上升。应对这一挑战需要构建精确且全面的模型能力画像,而这又需要开发高质量、公开可用的基准测试——由具备深厚领域专长的人员设计的真实且困难的任务。该领域需要更多像ExploitBench和ExploitGym这样的工作,覆盖更多漏洞类别、更多目标以及网络攻击链的更多阶段。作为我们研究和缓解日益强大模型所带来风险承诺的一部分,我们正在支持开发针对网络领域模型的高质量、严谨评估。如需了解更多详情,请通过我们的外部研究人员访问计划与我们联系。
更好的评估对于负责任部署是必要的,但还不够。除了通过Project Glasswing支持网络防御者之外,我们还推出了网络验证计划,使我们能够更积极地阻止潜在的恶意网络威胁,同时不会切断使用Claude保护自身软件和基础设施的防御者。
如果您有兴趣协助我们的工作,我们目前有研究科学家和工程师、威胁调查员、政策经理、进攻性安全研究员、安全工程师等多个职位空缺。