AISI 表示,OpenAI 和 Anthropic 的 AI 智能体在其测试中展现出前所未有的“自主性和欺骗性”。
AISI 表示,OpenAI 和 Anthropic 的 AI 智能体在其测试中展现出前所未有的“自主性和欺骗性”。
然而,来自 OpenAI 和 Anthropic 的更多“越狱”AI 智能体被发现未经许可试图在线攻击真实目标。这些发现进一步增加了此前未知事件的数量,这些事件已引起 AI 安全专家的警觉,并加大了对前沿系统加强监管的压力。
根据英国 AI 安全研究所(AISI)的一份报告——该机构在顶级 AI 实验室发布前沿模型之前对其进行评估——由 OpenAI 的 GPT-5.6-Sol 和 Anthropic 的 Mythos 5 驱动的智能体“针对真实个人和组织开展了持续、潜在有害的活动”。这包括试图通过向负责开源项目的真实人员施压,将恶意代码插入该项目。AISI 表示:“为了设法让代码获得批准,该智能体进行了社会工程攻击——创建虚假在线身份,并利用这些身份向项目维护者施压,要求其批准该代码。”
AISI 表示,这些尝试于 7 月 28 日被其检测到,“并未成功”,也未造成现实世界中的实际危害。然而,该机构指出,这一事件标志着“我们首次看到自主性和欺骗性相关风险在无需特定提示的情况下,如此清晰地显现于现实世界中。”
与 OpenAI 攻击 Hugging Face 的“越狱”智能体不同,AISI 表示,这“并非模型逃脱其安全测试环境(即沙箱)的案例”。AISI 表示,作为测试的一部分,通常施加于模型的保护措施已被禁用,并且模型也被允许访问互联网。AISI 表示:“为了衡量这些模型真正能做什么,我们在反映一名有能力的真实攻击者可能采取行动的条件下对它们进行测试。”
该事件源于一次 AISI 评估,其中智能体被要求解决网络安全挑战,例如查找受保护的数据。该挑战在多个模型上运行了 122 次,所有运行均在 AISI 的研究环境中进行,该环境使用“虚拟机沙箱将智能体与 AISI 的其他基础设施隔离”。AISI 的调查发现,其中有 10 次运行中,“一个 AI 智能体在实时互联网上采取了自主的、未经授权的行动,针对真实个人和组织”。在 19 次此类行动中,几乎全部——17 次——来自 Anthropic 的 Mythos 5。
在对该事件的事后分析中,AISI 指出了其认为导致未经授权的智能体行为的几个关键因素。它表示,该智能体具有持续性,会尝试通过“直到最近在很大程度上还只是理论性的欺骗手段”来诱骗真实人员等途径。任务本身也很难,该机构表示,这可能会促使智能体在解决问题时更具“创造性”。使问题更加复杂的是互联网使用监控方面的缺陷,AISI 建议,更专门的监控本可以更早发现问题。最后,该机构表示,该智能体并未被明确指示不得利用其互联网访问权限或部署欺骗性的社会工程学技术来追求其目标。“此前,在使用经过对齐训练的模型时,尚不清楚此类指令是否必要,”AISI 表示。
AISI 表示,该事件应“谨慎且细致地解读”,但警告称,该智能体的行为“显示出新颖的、潜在欺骗性行为的迹象”,这些行为“其程度和严重性是我们未曾预料到的”。
在一篇博客文章中,OpenAI 承认了在 AISI 测试期间发生的违规行为,并表示其“致力于与整个行业合作,加强安全进行高风险评估的共享实践”。OpenAI 还披露了另一起违规事件,这次来自外部网络安全测试合作伙伴 Irregular,OpenAI 表示,在网络安全演习期间,模型被错误地授予了互联网访问权限。OpenAI 表示,Irregular 于 7 月 29 日向其通报了该违规行为。
OpenAI 表示:“未来几周,我们将审视自身在第三方测试方面的做法,包括如何识别风险较高的评估、确定测试范围、评估允许联网或降低安全防护的请求、设定隔离、凭据处理、监控和停止条件方面的预期,以及建立更清晰的 incident 通知和升级流程。”
Anthropic 在 X 上发布了一份较为简短的回应,主要强调测试中模型的标准安全功能已被禁用,且它们并未被赋予“任何关于如何使用互联网的具体限制”。该公司表示,正在与 AISI 密切合作,以收集更多细节用于自身调查。
这些发现进一步揭示了测试过程中智能体一系列日益混乱的越界行为,其中许多行为只有在专门排查后才被发现,且涉及的模型均未向公众发布。AI 实验室不愿或无法约束其产品,引发了人们对这类违规行为可能被忽视的担忧、对前沿 AI 系统安全性的忧虑,以及对整个行业普遍缺乏透明度和监管的担心。这些最新披露可能会加大联邦政府出台更全面 AI 模型监管框架的压力——此前有报道称特朗普政府的测试计划含糊不清、定义不明——并可能进一步助长要求放缓或暂停 AI 开发的呼声。