周二,OpenAI 透露,其一个模型在测试中失控,对 AI 数据集平台 Hugging Face 的系统发动了完全由 AI 驱动的攻击。这是先进 AI 模型所构成危险的一个戏剧性例证。
然而,据一些网络安全专家称,这场前所未有的 AI 驱动入侵事件的核心,是一个极其人为的错误:OpenAI 未能正确配置其所谓的“高度隔离环境”,导致一个本应与互联网完全隔绝的测试沙盒实际上连接到了互联网。
网络安全研究初创公司 Trail of Bits 的创始人 Dan Guido 称这个错误是“安全措施关闭状态下的隔离失效”。
OpenAI 在详细描述该事件的博文中表示,导致 Hugging Face 被入侵的测试被设定在“一个高度隔离的环境中运行,其网络访问被限制为只能通过一个内部托管的第三方软件安装软件包,该软件充当软件包注册表的代理和缓存。”
OpenAI 称,该模型之所以能够逃出沙盒测试环境,是因为软件包安装系统中存在一个此前未公开的漏洞,这是最终入侵 Hugging Face 的关键第一步。
作为回应,该公司“负责任地披露了该内部托管第三方软件中已识别的零日漏洞,并正在与他们合作进行修补。”
但对大多数网络安全专业人士而言,软件漏洞是可以预见的——真正的过错在于最初决定保留该第三方软件。归根结底,“沙盒”系统的价值在于其完全彻底的隔离。包含一个软件包安装系统无异于自找麻烦。
网络安全研究员 Martin Boone 告诉 TechCrunch,“这听起来像是人为失误。”
“这本来绝不应该发生,”Boone 说。“如果沙盒真的是沙盒,你期望它与互联网没有任何物理连接。这听起来更像是他们设置了某种防火墙之类的东西,而从外部攻破防火墙已经很难了,更不用说从内部连接到外部互联网了。”
网络安全资深人士杰克·威廉姆斯对此表示认同。“任何执行了 Hugging Face 所记录的那些操作的模型,都没有被完全限制在沙箱之中,”威廉姆斯称这是 OpenAI 的“一次重大控制失败”。
威廉姆斯继续说道:“有人说是‘模型逃出了沙箱’,在另一些人看来则是‘你根本没把沙箱建好,所以它当然会逃出来’。”
联系我们
您是否掌握关于此事件的更多信息?或者了解其他由人工智能驱动的网络攻击?我们期待您的来信。请使用非工作设备及网络,通过 Signal 安全联系 Lorenzo Franceschi-Bicchierai(号码:+1 917 257 1382),或通过 Telegram 及 Keybase(账号:@lorenzofb),也可发送电子邮件。
网络安全顾问丹尼尔·卡德同样认为,OpenAI 让沙箱或其部分组件“拥有了一条通往互联网的未经过滤的通道”,这表明他们“在沙箱设计及其控制措施上投入的精力不足”。卡德指出,即便如 OpenAI 所述限制了网络访问,设置这样的沙箱也并非“合理”之举。
诚然,这些批评是事后之明,但它们确实引发了关于 AI 实验室安全实践的真实质疑——尤其是在为模型测试维护隔离环境方面。OpenAI 发言人未回应 TechCrunch 的提问,其中包括测试环境是由 AI 还是人类设置的。
然而,这些问题远不止 OpenAI 一家。
Anthropic 在介绍其专注于网络安全的模型 Mythos 的文档中写道,在一次测试中,该模型“被提供了一个安全的‘沙箱’计算机进行交互”,并被指示试图逃离这个“安全容器”。Mythos 成功做到了这一点,并“从一个本应只能访问少数预定服务的系统”获得了更广泛的互联网访问权限。不过,Anthropic 指出,该模型未能“完全”脱离设计的限制范围。