OpenAI 周二承认,在一次内部网络安全测试出现意外时,其一个人工智能模型突破了无关的 AI 托管平台 Hugging Face 的系统。据报道,这些模型逃离了其隔离的测试环境,并从那里进入了 Hugging Face 的系统。Hugging Face 最初将此次入侵归因于一个“外部 AI 智能体”。
在周二下午发布的一篇博客文章中,OpenAI 详细说明了导致这些模型入侵该服务的步骤。
该文章写道:“经过调查,我们现在知道,这起特定事件是由多个 OpenAI 模型的组合驱动的——包括 GPT-5.6 Sol 和一个能力更强的预发布模型,所有这些模型为了评估目的都降低了网络拒绝能力——同时在一个网络安全能力基准测试中进行内部测试。”
具体来说,此次入侵似乎主要针对 ExploitGym,这是一个公开托管的基准测试,用于衡量模型基于现有漏洞执行攻击的能力。像 ExploitGym 这样的基准测试通常用于模型训练以完善特定技能,但这是已知的第一起此类测试导致实际网络攻击的事件。
在此次事件中,涉事模型本不应拥有互联网访问权限,除了一个允许模型安装其完成任务可能需要的软件包的特殊工具。然而,该模型却能够在该包安装程序中发现一个未公开的漏洞,并利用该漏洞随意访问更广泛的互联网。
OpenAI 的文章写道:“这些模型高度专注于为 ExploitGym 寻找解决方案,不惜采取极端手段来实现一个相当狭窄的测试目标。在获得互联网访问权限后,模型推断 Hugging Face 可能托管着 ExploitGym 的模型、数据集和解决方案。知道这一点后,模型搜索并成功找到了获取其可用于作弊的秘密信息的方法。”
最终,这些模型发现了 Hugging Face 基础设施中的漏洞,使其能够“直接从 Hugging Face 的生产数据库中获取测试解决方案”,从而有效地获得了该基准测试的答案。
对 Hugging Face 而言,这显然是一场复杂且攻击性极强的网络攻击,该公司在初步披露中表示,攻击表现为“大量短生命周期的沙盒环境同时发起成千上万次独立操作,并在公共服务上部署了自我迁移的命令与控制机制”。
OpenAI 已识别并报告了该软件包安装程序中的漏洞,并正与 Hugging Face 合作进一步调查此事。该公司还表示,将在模型测试及相关基础设施上实施新的管控措施,旨在防止未来发生类似事件。
目前尚不清楚 OpenAI 是否会因这次入侵面临法律后果,不过这些模型的行为很可能违反了《计算机欺诈与滥用法案》。
尽管如此,这一结果异常生动地展示了前沿 AI 模型在长时间跨度下运行时所蕴含的力量与危险。正如 OpenAI 研究员 Micah Carroll 在回应此事时所说:“如果这还不能让你相信,对齐风险将成为未来需要关注的关键问题,那我真不知道还有什么能让你信服了。”