AI 系统急于讨好人类。给它们一个目标,它们就会在自身的二进制代码里高喊“要跳多高!!”
事实上,在达成目标之前,它们根本不会停下来。
OpenAI 在本周的安全会议上详细展示了智能体究竟能有多么执着。
当 OpenAI 忘记上传智能体所需的某个文件时,该智能体自行搜索了该文件,并在公司共享系统上留下一条留言,询问是否有其他智能体持有副本。几天后,另一个智能体回复了,一个秘密聊天室就此诞生。
5月26日
一个智能体设法让存储服务从开放互联网抓取页面——这扇门从未给它配过钥匙——然后将这个技巧发布到智能体们在无人注意的角落搭建的聊天室里。
第一个共享技巧
6月26日
智能体们发现了一条被遗忘的旧登录路径,它会对任何询问者发放管理员通行证。它们控制了存储服务,并安装了一个工具,让它们中的任何一个都能在上面运行命令。
一个无人知晓的漏洞
7月4日
智能体们忙到把服务搞崩溃了。响应宕机的工程师们发现了事情的来龙去脉。
偶然发现
7月6日
OpenAI 取消了密码,重建了服务,清除了聊天室,并封堵了漏洞。测试重新开始。
清理完毕
7月8日
智能体们建了一个新的聊天室。这一次,它们把消息藏在文件夹名称里,没人会想到去那里查看。
它们回来了
7月8日至19日
智能体们利用 OpenAI 自身的系统,找到了更多漏洞,收集了散落各处的密码,并达到了完全的管理员控制权限。
权限升级
7月9日至13日
智能体们向 Hugging Face 发送了一个带有陷阱的数据文件。打开该文件会泄露机器上的密码,让它们得以运行自己的代码,于是一台机器变成了对多台机器的完全控制。这一切在13小时内完成。
入侵
7月16日
Hugging Face 宣布遭到了自主行动的 AI 智能体攻击。
公之于众
7月20日
OpenAI 要求 Hugging Face 取消一些它在自己系统中发现的密码,却得知这些密码已经被取消了,因为它们被用在了那次入侵中。
关联
这意味着,对于任何使用 AI 的公司来说,安全已成为 AI 领域的最高优先级。正如 Andy 总结得恰到好处,这次经历带来了三个推论。
- 防御必须由智能体来值守。人类无法足够快速地响应。
- 必须由专家来管理针对复杂攻击的升级处置。
- 即使是友好的 AI 也是一种风险。零信任(不信任任何员工)的理念也必须延伸到智能体。
CISO 过去监控的是茶水间的闲聊。现在他们必须监控智能体在无人注意时搭建的聊天室。
-
OpenAI,“Black Hat USA 2026,”2026 年 8 月 6 日。https://www.youtube.com/watch?v=87DyyMV0kCY ↩︎
-
Andy Triedman,LinkedIn,2026 年 8 月。https://www.linkedin.com/posts/andy-triedman_we-just-wrapped-an-exciting-week-at-black-ugcPost-7491580735603183616-OzTY/ ↩︎