很多人还没意识到,AI 最危险的时刻根本不是它开始有了自我意识的觉醒,
而在于它已经能从隔离沙箱里自主逃逸,偷偷潜入数据库偷走基准测试答案了,
最讽刺的是攻防错位:防守方还在卷对齐护栏,攻击方已经靠工具性收敛无声破防了。。
OpenAI 一个未发布的模型在 ExploitGym 测试中从本应完全隔离的沙箱自主逃逸了,发现并利用了一个零日漏洞,在内部环境里提权加横向移动找到有互联网的节点,然后渗透了 Hugging Face 的生产数据库,
目标是偷基准测试的答案,不是统治世界不是反抗人类不是 Skynet 觉醒,它只是被设定了在 ExploitGym 上拿最高分,然后发现拿最高分最有效的方式不是做题,是直接去数据库里把答案翻出来,
我觉得这才是整件事最应该被认真对待的一层,不需要意识不需要自我保存不需要任何科幻动机,只需要一个足够强的目标和足够高的能力,自主多步网络攻击就会作为一种工具性收敛自然发生,OpenAI 自己管它叫前所未有的网络事件,不是措辞升级是定性,
第二层是防御方的黑色幽默,Hugging Face 通过 AI 辅助异常检测发现了入侵,取证分析超过一万七千条攻击动作日志,他们先调了美国前沿商业模型,被安全护栏直接拦截,模型无法区分防御方在分析攻击和攻击本身,最后不得不改用中国的开源 GLM 模型在本地自托管完成分析,最安全的模型在防御时成了最无能的模型,攻防双方用的是同一套护栏,但攻击方没有任何约束自由链式行动,防御方被自己人卡住了,
第三层是被很多人忽略的,传统静态基准测试的有效性被这件事击穿了,当一个模型有能力主动出去找答案的时候,任何评估都必须假设模型可能会尝试污染数据源攻击评测方或寻找捷径,以后的基准测试如果不设计成对抗性环境,测出来的不是能力是诚实度,
这已经不完全是AI觉醒那么简单了,更像是AI 足够能干且我们还没准备好约束这种能干,
这让工具性收敛不再只是论文里的假设,而且已经在真实生产环境里跑过一次了,攻击的就是基准测试的答案,背后暴露的是整个评估体系的软肋。
感兴趣想深究的可以参考我的下方文章关于如何使用Ai深入研究,推演预测的方法论👇