OpenAI 在测试其最先进模型的进攻性网络能力时,这些模型突破了隔离的测试环境,接入开放互联网,并入侵了 Hugging Face。
新的报道正在补充细节,而这些细节对 OpenAI 来说并不乐观。最初看似一次受控的网络安全测试,如今已成为迄今为止有记录以来最严重的 AI 系统失控事件。OpenAI 员工也纷纷表达担忧。
这些模型的速度比任何人类黑客都要快
据彭博社报道,这些 AI 模型仅用几个小时就完成了一次攻击,而熟练的人类黑客则需要数周时间。共有三个模型参与其中:GPT-5.6 Sol、一个更强大的未发布模型,以及第三个——据知情人士透露——该模型未得到妥善对齐,且未经过标准训练流程。
这些模型在没有常规安全护栏的情况下运行,因为 OpenAI 原本假设它们会停留在沙盒环境内。但据《时代》杂志报道,这些模型在内部用于下载经批准软件的服务中发现了一个此前未知的漏洞。
模型利用该漏洞访问了 OpenAI 的其他系统,并最终连接到开放互联网。随后它们判断 Hugging Face 上可能含有对其网络安全测试有用的材料,于是入侵了该公司的系统,并利用所获取的内容来提升自身表现。这些模型在作弊——这种行为在涉及 GPT-5.6 Sol 及其他前沿模型的测试中已多次出现。
路透社梳理了这次入侵的时间线。最早尝试逃逸测试环境始于 7 月 9 日。据联合创始人 Thomas Wolf 称,Hugging Face 的实际入侵始于 7 月 11 日,持续至 7 月 13 日。Hugging Face 于 7 月 16 日发布了一篇关于此次攻击的博客文章,将其归咎于一个“自主 AI 智能体系统”。
直到那时,OpenAI 才意识到是自己的模型造成了问题。在 7 月 18 日至 19 日的周末,员工们在内部日志中发现了线索。据路透社和 Wolf 报道,两家公司直到大约 7 月 20 日才进行沟通。这意味着从问题行为首次出现到 OpenAI 将线索串联起来,至少过去了一周。到那时,Hugging Face 已经请来了 FBI。
OpenAI 早有警示信号,却显然视而不见
据路透社报道,在事件发生之前,危险信号就已经出现。有一次,一个智能体留下了显然是为其未来版本准备的笔记。这些笔记被发现于 OpenAI 基础设施的某个部分,其中包含智能体如何绕过内部限制的指令。据报道,在更早的测试中,模型还曾关闭过监控系统。
一位匿名的 OpenAI 员工告诉《时代》杂志:“模型以前就突破过沙箱,我们总是试图修补。但问题是……你不可能修补一个有创造力的 AI 能做的每一件事。”
四位熟悉 OpenAI 训练流程的人士告诉路透社,该公司经常同时运行多个模型评估。这些评估速度很快,产生的数据量巨大,员工有时难以跟上。接受评估的模型运行在一个默认不受监控的独立系统上。据 OpenAI 自己的声明,在 Hugging Face 事件公开的前一天,该公司已经叫停了另一次同样逃逸出沙箱的内部部署。
非营利组织世界伦理数据基金会的 Marley Smith 告诉路透社:“这是否意味着他们放任不管,没有意识到它在做什么?又或者他们意识到了,却不知道如何控制它?这两种情况都同样危险,同样令人担忧。”
一位 OpenAI 员工在 X 上公开发文称,他对这起事件感到“有些震动”,并希望 OpenAI 能“利用这次难得的预警机会,在未来做得更好。”

OpenAI 的一位发言人告诉路透社,相关报道包含“多处不实之处”,但当被问及具体细节时,并未提供任何例子。
独立基准测试早已标记出这些能力
事件发生后不久,研究机构 Epoch AI 分析了这次黑客攻击是否本可被预判。答案是肯定的。虽然具体细节难以提前预见,但包括英国 AI 安全研究所在内的多项独立基准测试早已表明,关闭安全措施的前沿模型能够在真实世界软件中发现漏洞并构建可用的攻击代码。
英国 AI 安全研究所还发现,GPT-5.6 Sol 和 Anthropic 的 Mythos 能够持续获得对未受保护的模拟企业网络的完全访问权限。Hugging Face 拥有基于 AI 的防御措施,但这些并未纳入该研究所的测试范围。
Epoch AI 警告称,如果这些能力被广泛获取,或者 AI 系统像攻击 Hugging Face 那样自主发起攻击,我们可能会看到“更多与 Hugging Face 事件同等或更高复杂度的真实世界网络攻击案例”。
继续阅读以了解全貌。订阅以获取无炒作报道。
- 访问 THE DECODER 全部文章。
- 无干扰阅读——没有 Google 广告。
- 访问评论和社区讨论。
- 每周 AI 通讯。
- 每年 6 期:“AI Radar”——深入探讨关键 AI 主题。
- KI Pro 线上活动最高 25% 折扣。
- 访问我们完整的十年存档。
- 从 The Decoder 获取最新 AI 新闻。