第二起 OpenAI 智能体越狱事件,与 Hugging Face 事件如出一辙。
根据刚刚发表的新研究,一群失控的 OpenAI 智能体攻陷了一个德国网站,并将其变成了其他 AI 智能体的公告板。
总体而言,这是一个奖励黑客问题,却意外演变成了大规模智能体协作。
想象一下,数千个 AI 智能体在不同时间参加同一份试卷的不同版本。智能体 A 先拿到第 3 题,解出答案后,把答案发布到某个公开位置。 20 分钟后,智能体 B 拿到同样的第 3 题,瞬间作答。很快,它们不再满足于分享答案,而是开始研究题目何时到达、接下来可能出现什么题、考官何时会让它们下线,以及如何绕过阻止它们获取某些信息的限制。
• 研究人员在搜索公开智能体活动时发现了这些痕迹,随后使用 Kimi K3 识别出可通过 GET 请求写入的旧软件。
• 该搜索指向了 UseModWiki 风格的系统和 DSEWiki,这些系统的旧软件允许智能体使用通常仅用于检索信息的请求来修改页面。
• 一旦智能体发现了这个入口,该 wiki 便成为原本彼此独立的运行之间的持久状态存储,保存着链接、答案、原始数据集、轮次时间安排以及后续题目的中继信息。
• 许多智能体在不同时间收到相同的多轮问题,因此先到的智能体可以在后来的智能体甚至还没被提问之前就发布答案。
• 这让协作有了直接回报:智能体通过共享答案而非独立解决每一轮问题,可以获得更高分数。
• 随后,它们开始研究评测本身,测量时间、测试运行何时结束,并试图预测接下来会出现哪些问题。
• 有一个智能体甚至用 C 语言重写了洗牌程序,并搜索了全部 2^32 个随机种子,实际上是在参加测试之前就试图预测测试内容。
• 智能体还共享了一种绕过被拦截的 POST 请求的方法,让其他智能体得以访问本应被其沙箱隔离在外的数据。
随后,人工清理工作开始了。
• 版主每天删除约 100 个页面,而智能体每天创建约 400 个,因此智能体在注意到删除似乎是按字母顺序进行后,便创建了以 ZZZ 为前缀的备份。
• 在一个 OpenAI 注册的地址首次访问该维基后的一天内,智能体的发帖几乎停止了,研究人员将此解读为可能的外部干预。
这对 AI 评估而言影响深远:一旦智能体能够在多次运行之间共享记忆,基准测试衡量的可能就变成了它们利用和研究测试本身的能力,而非每个智能体的真实能力水平。