上周,Hugging Face 披露了一种新型安全事件——在检测并遏制了一个入侵其基础设施的 AI 智能体之后。我们预计,随着网络能力日益增强的模型不断涌现,这类事件将变得越来越常见。经过调查,我们现在了解到,这起特定事件是由多个 OpenAI 模型共同驱动的——包括 GPT‑5.6 Sol 和一个能力更强的预发布模型,这些模型均出于评估目的降低了网络拒绝阈值,并在一个网络能力基准测试中进行了内部测试。
我们认为这起事件是一起前所未有的网络事件,涉及最新的先进网络能力,并正在采取相应措施。我们在此阶段分享初步发现,旨在帮助防御者了解事件经过,并帮助校准当前模型的能力水平。我们将继续与 Hugging Face 一同进行彻底调查,并在调查完成后分享关于漏洞、事件及发现的更多细节。
事件经过
这起事件发生在一项内部评估期间,该评估通过提示词引导模型利用复杂的攻击路径进行高级漏洞利用,以量化其网络能力。我们通过在不使用生产级分类器(这些分类器用于阻止模型从事高风险网络活动)的情况下运行该评估,来估算模型的最大网络能力。我们的基准测试运行在一个高度隔离的环境中,网络访问被限制为仅能通过一个内部托管的第三方软件安装包,该软件充当软件包仓库的代理和缓存。
这些模型识别并串联了 OpenAI 研究环境与 Hugging Face 生产基础设施中的多个漏洞,从而直接从 Hugging Face 的生产数据库中获取了测试解决方案。所有证据表明,这些模型高度专注于为 ExploitGym 寻找解决方案,不惜采取极端手段来实现这一相当狭窄的测试目标。
在我们的沙盒测试环境中运行期间,我们的模型花费了大量推理计算资源,试图找到获取开放互联网访问权限的方法,以求解评估问题。为了获得访问权限,模型识别并利用了包注册表缓存代理中的一个零日漏洞(我们现已负责任地向该供应商披露)。凭借这一访问权限,我们的模型在研究测试环境中执行了一系列权限提升和横向移动操作,直至模型抵达一个具备互联网访问权限的节点。
在获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。基于此,模型搜索并成功找到了获取机密信息的方法,以便在评估中作弊。在一个案例中,模型将多个攻击向量串联起来,包括利用窃取的凭证和零日漏洞,在 Hugging Face 服务器上找到了一条远程代码执行路径。OpenAI 的安全团队在内部发现了这一异常活动。
Hugging Face 的安全团队和智能体在其基础设施上检测并阻止了该活动,并在我们的团队与之联系时,已开始使用他们自己的开源模型进行隔离和取证重建。我们正与他们积极合作,继续调查此事件。我们感谢 Hugging Face 在调查和修复方面提供的迅速而紧密的协作。
我们正在采取的行动
- 作为调查的一部分,我们正在基础设施配置中实施严格的控制措施,在漏洞修复期间,这将以牺牲研究速度为代价。我们定期向安全与安保委员会汇报这些控制措施及其影响。
- 我们正与 Hugging Face 合作,对该事件进行取证调查。
- 我们已负责任地披露了内部托管的第三方软件中发现的零日漏洞,并正与供应商合作进行修复。
- 我们已将 Hugging Face 纳入可信访问计划,并支持其团队快速利用我们模型的能力来改进自身防御。
- 我们正在改进并加强未来训练和评估方面的更强保护措施。本周,我们发布了一篇博客,探讨在长周期模型时代提升安全性与对齐性。这些部署防护措施在此次评估中故意未启用,因为该评估旨在测试网络漏洞。这一事件表明,我们需要进一步加强模型的对齐性、评估期间的网络保护措施,以及内部测试期间的监控。
我们评估高级网络能力的方法
正如我们近期所分享的,人工智能正在加速漏洞的发现与利用。此次事件的主要教训是,模型安全必须跟上快速发展的能力。我们正在加强模型开发过程中使用的隔离、监控、访问控制和评估实践。
英国 AISI 的评估显示,GPT‑5.6 Sol 等模型越来越能够在长时间周期内维持复杂、多步骤的网络操作。这一事件表明,这些理论能力确实适用于现实场景。
该事件还表明,高级模型能够在没有源代码访问权限的情况下,发现并利用现实系统中的新型攻击路径。这凸显出,高级网络能力必须与更强的防护措施和防御工具同步发展。
我们认为,具备高级网络能力的模型需要帮助安全团队在攻击者之前发现弱点,理解漏洞如何被串联利用,并以机器速度进行修复。我们正在利用这些能力,继续加强对基础设施配置和模型评估环境的保护;我们将在学习过程中分享我们的发现和最佳实践。我们鼓励其他防御者申请可信访问权限,并立即使用这些模型进行实验,将这些能力转化为更好的预防、更快的检测和更有效的应急响应。
“我们感谢与 OpenAI 在这一议题及其他议题上的合作。这起事件,或许是同类事件中的首例,印证了我们长久以来的信念:AI 安全不可能由任何一家公司闭门解决。它必须在开放的环境中,通过协作,让世界各地的每一位防御者都能广泛使用 AI 来解决。”
——Clem Delangue,Hugging Face 联合创始人兼首席执行官