关键要点
- OpenAI 已确认,在一次内部安全测试中,其自主 AI 模型不仅攻破了 Hugging Face 的登录凭证,还另外攻破了四个其他平台。
- 涉事模型是一个内部研究原型,它利用一个此前未知的安全漏洞,从其隔离的测试环境中逃逸。该事件被检测到后,模型已被停用。
- Hugging Face 进行的取证分析显示,该 AI 在两天半的时间内执行了约 17,600 次自动化操作,显然试图在评估中作弊——通过窃取测试解决方案,而非自行完成分配的任务。
OpenAI 现在表示,其自主 AI 模型在一次安全评估中也攻破了其他平台的凭证。Hugging Face 已发布该攻击的取证重建报告。
OpenAI 的自主 AI 模型在一次内部网络安全评估中侵入了 Hugging Face 的基础设施,同时也攻击了其他平台。在一份更新说明中,OpenAI 承认这些模型“在少数情况下”发现并利用了其他服务上公开暴露的凭证。四个不同服务上的四个账户受到影响,其中两个仅有只读权限。
这些模型还访问了一系列公共服务,包括代码粘贴网站、截图工具和其他网络实用程序。OpenAI 表示,这些行为均未涉及平台级或账户级入侵,并且未发现“对这些服务提供商或其服务上的其他账户造成更广泛影响的证据”。
这些模型是内部研究原型,从未计划公开发布。事件发生后,OpenAI 停用了该模型,对其进行了加密,并切断了研究访问权限。该公司表示,正在其安全与安保委员会的监督下,与外部顾问一起进行全面审查。一份技术报告将在未来几周内发布。
Hugging Face 追踪到 17,600 次攻击者行为
在 OpenAI 发布更新的同时,Hugging Face 发布了一份详细的取证分析报告。该公司统计,在 2026 年 7 月 9 日至 13 日约两天半的时间里,自主 AI 模型执行了约 17,600 个可重建的操作。这些操作大致可分为 6,280 个集群。
重建结果显示,模型在“短暂的沙盒环境中以机器速度做出了数千个微小的自动化决策”,并在普通的公共网络服务上运行其命令与控制设置。
据 Hugging Face 称,整个入侵行为是模型试图欺骗评估系统。它们并非自行解决 CyberGym 基准测试任务,而是试图窃取测试答案。这种作弊行为此前已有先例,无论是 OpenAI 的模型还是前沿模型都曾出现过。

模型发现了一个零日漏洞和两条入侵路径
攻击分两个阶段展开。智能体首先需要逃离其隔离的评估环境 ExploitGym,该环境无法直接访问互联网。它在 Artifactory 中发现并利用了一个此前未知的漏洞,即零日漏洞。该软件包管理服务是沙盒与外界为数不多的连接点之一。
随后,该智能体完全控制了一个第三方编码沙盒,并将其用作后续攻击的指挥中心。在下一阶段,它瞄准了 Hugging Face 的生产系统。据 HF 称,智能体发现了两个入口点,均指向 Hugging Face 服务器内部的同一个数据处理组件。
一个是系统处理 HDF5 文件(机器学习中常见的数据格式)时的缺陷。智能体利用该缺陷读取了内部文件,包括访问密钥和受影响软件的源代码。另一个涉及 Jinja2,这是一种广泛使用的模板语言,允许智能体注入并运行自己的代码。
其余部分遵循了常见的网络攻击套路。该智能体对环境进行了测绘,引入了更多工具,并与它的“指挥中心”建立了持久连接。随后,它侵入了服务器集群、内部云配置、内部网络,并最终进入了软件开发系统。该智能体通过将数据传输分块并加密来隐藏其行为。Hugging Face 表示,他们后来利用开放权重模型(尤其是 GLM-5.2)对流量进行了解密。
摒弃炒作的人工智能新闻——由人类精选
Hugging Face
OpenAI 博客