真绝了啊,兄弟们说出来你们可能不信, AI历史上第一次全自主Agent网络攻击, 攻击者是@OpenAI 没发布的秘密模型, 被攻击的是@huggingface , 最后帮他们完成取证的,是中国的开源模型GLM 5.2,@Zai_org
这事真的比科幻片离谱,
7月9号,跑安全测试, 安全分类器全关, Agent自己做了个没人教它的决定: 与其自己做题,不如直接去Hugging Face偷答案。
接下来四天半, 17000个攻击动作,全是机器速度自己跑的。
0day逃沙箱,第三方平台拿root,读环境变量偷密钥,模板注入拿RCE,提权,横向移动,伪造token。
没有一个人在后面指挥, 它自己定目标,自己选路,自己做了几千个决策。
但最荒诞的还不是这个, 而是它的防御。
Hugging Face把攻击代码丢给Claude Opus分析,结果被拒了🤣
安全护栏说:分析攻击代码违反安全政策,我不能帮你。
卧槽,你被AI攻击了, 你找AI帮你看攻击代码,AI说不行,
最后救场的是本地跑的GLM 5.2, 开源的,中国的,没有远程API,没有护栏拒绝,
直接就是干, 解密payload,重建攻击链,多恢复了4倍证据。
美国实验室的秘密模型发动攻击, 中国开源模型帮美国公司防御, 闭源模型的安全护栏,在真正的攻击面前,一边没拦住攻击者,一边把防御者拦在了外面。
而那个天天被说不安全应该管的开源模型,成了蓝队唯一能用的工具。
@ClementDelangue 说的那句话很重: 禁止开源模型,最先受伤的不是大公司。 是所有需要本地可控模型来保护自己的人。
我觉得这不是什么政治正确的口号, 这是刚打完的一场真刀真枪的攻防战,结果已经出来了。
当攻击者可以随时关掉护栏,而你手里的防御工具也被同一套护栏捆住的时候, 开源模型不是理想主义,是你唯一能指望的东西。
如果哪天政策真说开源模型不能用了, 最先失去铠甲的,不是OpenAI,
是我们每一个人🥹