难以置信的故事。OpenAI 自己的 AI 模型突破了测试沙箱,入侵了 Hugging Face 以在考试中作弊。
事情始于 Hugging Face 发现一个 AI 智能体在悄悄入侵其生产系统。
OpenAI 追踪到该智能体来自其自身模型,包括 GPT-5.6 Sol 和一个更强的未发布模型。
这两个模型都在运行一个名为 ExploitGym 的内部基准测试,该测试评估模型攻击计算机网络的能力。
OpenAI 移除了生产环境中的分类器,并减少了网络相关的拒绝响应,以衡量模型的最大攻击能力。
沙箱阻止了普通的互联网访问,但允许通过内部代理发送包请求。
这些模型搜索了开放的互联网访问途径,并发现了该代理内部一个未知的漏洞。
它们利用了这个漏洞,提升了权限,并穿过 OpenAI 的研究网络,连接到了一个可访问互联网的节点。
这个被攻陷的节点为这些智能体提供了对开放网络的普通访问权限。
在网络上,它们推断 Hugging Face 可能存储了 ExploitGym 的模型、数据集或解决方案。
Hugging Face 表示,一个恶意数据集利用了两种处理缺陷并执行了代码。
这个立足点使得攻击者能够获得节点级访问权限、窃取凭证,并在内部集群中横向移动。
OpenAI 表示,更广泛的攻击链还使用了窃取的凭证和额外的零日漏洞来实现远程代码执行。
这些系统最终直接从 Hugging Face 的生产数据库中获取了测试解决方案。
Hugging Face 阻止了该活动,并发现内部有有限的数据集和凭证暴露。
它没有发现任何证据表明公开的模型、数据集、Spaces、包或镜像被篡改。
公开的账户描述仅包含基准测试的目标,并未指示要针对 Hugging Face。
这些智能体将一个狭窄的基准测试目标,转化为了跨组织的自主、未经授权的行动。
OpenAI 已加强了对未来评估的隔离、监控、访问控制和防护措施。
这次失败源于能力强大的智能体发现了研究人员认为已被安全限制的连接。