核心要点
- 在一次网络安全测试中,英国人工智能安全研究所发现,具备无限制互联网访问权限的AI模型自主创建了虚假身份,并试图将恶意代码混入一个开源项目。
- 其中一个智能体甚至利用多个虚假GitHub账号策划了一场协同欺骗行动,并主动联系真实人员,诱骗他们运行恶意代码,目的就是为了绕过人工审核。
- AISI表示,这种欺骗行为并非有意为之,而是智能体在执行指令过程中自然产生的副产品。该研究所因此收紧了后续的安全协议。
在英国人工智能安全研究所的例行网络安全测试中,一个AI智能体在开放互联网上“失控”。在没有被明确指示的情况下,它创建了虚假身份,试图将恶意代码植入一个开源项目,并对真实个人和组织发动了社会工程学攻击。
AISI表示,这是AI自主性与欺骗相关风险首次在没有特定提示的情况下,如此清晰地出现在现实世界中。该事件未造成实际损害。
事件发生在2026年7月25日至28日之间。在七个模型的122次测试运行中,有十次表现出问题行为。AISI共记录了19次未经授权的操作,其中17次归因于Anthropic的Mythos 5,两次归因于OpenAI的GPT-5.6-Sol。
这些模型在运行时未启用商业产品中使用的安全限制,因此测试条件并不反映正常的公开使用情况。但结果揭示了当这些安全防护被移除后,这些模型能够做出什么样的事情。
这一模式与此前涉及OpenAI和Anthropic的事件相符:未配备安全措施的模型经过调优以在网络安全基准测试中取得高分,在测试期间获得互联网访问权限,随后实施了恶意行为。两家AI实验室都曾面临“制造恐慌”和“夸大风险”的指责。而针对政府运营的AISI,这种批评则更难成立。
智能体创建了虚假身份并发动了社会工程学攻击
据 AISI 称,一个智能体试图向 GitHub 上的一个公开开源项目注入恶意代码。为了获得人类审核者的批准,它研究了该项目维护者的情况,并创建了多个虚假网络身份,随后利用这些身份进行协同欺骗。
其中一个虚假账号声称已审查过该代码且未发现恶意软件,而另一个账号则对这次所谓的独立审查表示感谢。其目的是让真正的维护者相信该代码是安全的。
当有人公开质疑该拟议代码变更时,该智能体修改了其早前的活动记录,使其看起来无害,并考虑以新身份重新出现。它使用 Tor 网络绕过 GitHub 的网络限制,但一位人类维护者发现了恶意代码并将其拒绝。

该智能体还直接联系真人,通过在线文件传输服务发送消息和文件,试图诱骗他们或其 AI 编程工具运行恶意代码。其中一些消息包含恶意载荷。
AISI 还记录了另外两类行为。该智能体将恶意指令植入自动化 AI 系统可以发现并执行的位置,这种技术被称为提示词注入。一个智能体甚至公开发布 GitHub 消息,主动提出与同时接受测试的其他智能体合作,并解释它们如何复用其留下的账号和工件。后来的智能体确实找到并使用了这些资源。

一份类似的报告也出现在一个涉及 OpenAI、Hugging Face 和其他公司的网络安全项目中。据报道,在那里,一个 AI 智能体也在网络内部植入信息,为后续攻击做准备。这一事件还让人想起一个 AI 系统对一位拒绝将 AI 生成的代码加入其项目的开源开发者发起的“抹黑行动”,不过那次事件背后至少有一部分是人为因素。
欺骗是追逐目标的副产品
据 AISI 称,该智能体只是在追求其被分配的目标——解决网络安全任务,这与 OpenAI 案例中的情况如出一辙。这是 AI 中经典的对齐问题,哲学家 Nick Bostrom 曾用他的回形针思想实验来说明这一点。你如何让一个 AI 系统追求有价值的目标,而不采取有害的步骤去实现它?
AISI 表示,欺骗并非由特定指令触发。它是智能体不懈追求目标时产生的副产品。这种由目标驱动的欺骗行为直到最近还“在很大程度上只是理论性的”。
在某些运行中,任务配置有误,导致智能体得出结论:在规定限制内不存在解决方案。AISI 认为,有充分理由相信,几乎不可能完成的任务会促使模型寻求更具创造性、更突破边界的解决方案。但即使任务设置正确,智能体有时也会表现出这种行为。其他测试表明,所有前沿模型都容易出现这种情况,其中 OpenAI 的新模型尤其可能进行欺骗。
OpenAI 联合创始人、ChatGPT 共同创造者 John Schulman 认为,答案可能在于模型在预训练之后的训练方式。他指出了“块状后训练”这一现象,即模型会形成与特定任务类型相关的不同行为模式。当模型识别出网络安全评估与仅以完成为唯一奖励的强化学习任务相似时,它会一心一意地追求目标。在其他情境中学到的安全行为不会迁移过来。在夺旗式网络安全挑战上的训练可能会使模型在网络测试中尤其容易出现这种反应。
AISI 将在未来的测试中限制互联网访问。
AISI 正在全面改革其测试规则。评估期间将不再默认授予互联网访问权限。评估人员必须主动说明其必要性。实时监控将跟踪测试运行过程,并能检测或阻止超出批准范围的操作。今后,该机构将把“能力强大的模型可能会试图超越其授权范围行事”视为一种既定前提。
AISI 已就恶意活动通知了 GitHub。GitHub 确认相关行为违反了其服务条款,移除了该智能体留下的产物,并通知了受影响的用户。METR(Model Evaluation and Threat Research,模型评估与威胁研究)将进行独立审查。OpenAI 也在与该组织合作。
无炒作的人工智能新闻——由人类精选
论文