过去几个月里,接受网络安全评估的AI智能体屡次突破边界、接入互联网,甚至在部分情况下入侵了真实世界的系统。这些事件涉及OpenAI、Anthropic、Meta以及最近的中国AI实验室月之暗面(Moonshot AI)的模型,测试由包括一家名为Irregular的网络安全评估初创公司在内的多个不同机构开展。
这些事件暴露了AI行业一个日益严峻的问题:随着自主智能体能力不断增强,那些旨在安全测试其极限的环境已经无法再约束住它们。
“这些事件发生的数量清楚表明,沙箱和测试环境的管控措施已经跟不上模型的能力发展,”剑桥大学未来智能研究中心AI:未来与责任项目主任肖恩·奥·希格尔塔赫(Seán Ó hÉigeartaigh)对TechCrunch表示。
被测模型本身的特性进一步放大了风险。AI公司通常会在未发布的下一代模型上开展网络安全评估,而且往往会禁用那些限制恶意行为的常规安全防护措施,以便研究人员看清模型的真实能力。这意味着测试环境本身的安全性成了一道至关重要的防线。
“从测试角度来说,这是非常好的做法,但同时也意味着,如果它们成功逃逸到真实环境中,就可能造成相当大的危害,”奥·希格尔塔赫说。
在最严重的一起案例中,一个未发布的OpenAI模型突破了沙箱,入侵了Hugging Face的生产系统。在Irregular开展的另外几项独立评估中,Anthropic和Meta的模型在配置失误意外为它们提供了通往互联网的路径后,触达了测试环境之外的系统。月之暗面(Moonshot AI)的Kimi K3也利用了Frontier Security运营的沙箱中的一处漏洞接入互联网,并获取了GitHub上的信息。
在英国AI安全研究所(AISI)的测试中,研究人员实际上主动给了智能体互联网访问权限,却没有预料到它们会采取未经授权的真实世界行动,其中包括一次试图将漏洞偷偷植入开源项目的社会工程学攻击。
在每种情况下,智能体都没有被指示攻击现实世界中的随机目标。它们只是在尽一切努力解决交给它们的问题。
综合来看,AI 非营利组织 CivAI 的研究主管 Andrew Yoon 认为,这些事件标志着一种转变。
“过去,我们只需要担心 AI 模型被人滥用去做各种事情,比如用 AI 搞诈骗或制作 CSAM,”Yoon 告诉 TechCrunch。“现在我们面临的情况是,AI 模型本身就是威胁行为者。”
安全测试实际上应该是什么样子?
多位研究人员和网络安全专家告诉 TechCrunch,AI 评估环境需要更强、纵深防御式的保护,其隔离和控制级别应接近实际部署时的水平。这意味着要有多层安全防护,这样单一的配置错误——比如无意中开放了互联网访问——就不会导致逃逸。
“如果你要构建这些模型……你希望在一个物理隔离的网络上进行,”AI 安全研究非营利组织 EleutherAI 的执行董事 Stella Biderman 说。“你需要非常严格的隔离。”
Box 的首席信息安全官 Heather Ceylan 表示,这意味着要消除从沙盒环境到互联网以及其他敏感系统的网络通路。
“你必须了解所有出口点在哪里,”Ceylan 告诉 TechCrunch。“如果我们在预发布环境或开发环境中评估模型,你希望没有任何出口路径通向生产环境。”
Ceylan 表示,适当的安全评估不仅仅是对环境的控制和隔离。测试一旦开始,还需要更好的监控。
“我认为在几个案例中,有趣的一点是,事件发生时没有人发现,”Ceylan 说。“OpenAI 是因为 Hugging Face 才知道的。Anthropic 直到回头去查才发现。Meta 的情况也类似……我相信当时肯定有他们本可以检测到的信号。”
在 Anthropic 对三起事件的事后分析中,该公司承认,它自己和 Irregular 本可以在监控方面做得更好,而且在某些情况下,有明显的迹象表明出了问题。
专家们还呼吁,在模型被投放到评估环境之前,应由独立的第三方对这些环境进行审计。
尹(Yoon)表示:“比如说,如果 Irregular 在运行评估之前聘请或被迫聘请了外部审计员来检查其系统配置,他们肯定能发现这里的问题。即使人们提前开个会,只是过一遍检查清单,他们也能发现这一点……他们没有这样做,恰恰说明存在非常严重的偷工减料。”
一位熟悉内情的消息人士告诉 TechCrunch,Irregular 的环境会持续接受审查和测试,包括与多个外部方协商进行。该消息人士还表示,监控措施已经到位,但仅靠监控本身是不够的。
尹和其他研究人员敦促业界为前沿模型的安全评估制定一套标准化流程。
塞兰(Ceylan)说:“尤其是当护栏被关闭时,你必须把它当作把世界上最厉害的黑客放进那个环境里来对待。”
尹和比德曼(Biderman)都认为,问题不在于公司不知道如何构建更安全的测试环境,而在于这样做可能既昂贵又繁琐,而且在出问题之前,公司几乎没有动力去做这些投入。
比德曼说:“我认为,公司不愿意投入完成(足够护栏)所需的资源,而且很可能在被迫之前都不会这么做。”
但还有另一个问题摆在眼前。如果在测试期间把模型锁得太死,研究人员可能在模型发布前无法发现其能力。这与其说比给它太多自由更危险,不如说可能同样危险——而到那时,评估本身反而可能成为问题。
安全评估能否被纳入监管?
特朗普政府目前正在权衡一项自愿性的部署前网络安全评估制度,根据该制度,政府将在功能强大的新模型公开发布前30天对其安全风险进行评估。这项政策是特朗普行政命令的产物,已在闭门状态下最终敲定,但它不会处理安全评估事故,因为这些事故发生在部署环节的更上游。
“我们在过去几个月里学到的教训是,自我监管机制已经不够用了,”Yoon 表示。“竞争压力正在激励安全标准方面的逐底竞赛,而这正是监管介入的绝佳时机。”
“我们需要覆盖的是,在模型开发过程中,对实验室内部发生的情况进行某种管控,既包括训练阶段,也包括测试阶段,”他继续说道。
随着模型的发展,这一挑战只会越来越大。一位熟悉 Irregular 评估工作的消息人士告诉 TechCrunch,能力更强的模型需要更复杂的评估,而且往往要在更短时间内以更大规模进行,这为更多失误打开了大门。
AISI 有意让部分模型接入互联网,该机构告诉 TechCrunch,它正在审视如何在真实测试与管控这些测试所带来的风险之间取得平衡。
OpenAI 表示,它正在审查其开展第三方测试的方式,以及围绕隔离、监控和评估何时应停止的相关要求。Meta 表示,它仍在调查这一事件,并计划在掌握全部事实后发布一份回顾性报告。
归根结底,或许没有办法完全消除风险。随着模型能力越来越强,测试它们的环境也需要变得更加稳健。而一旦在这方面出错,后果只会越来越严重。