所有大模型公司都告诉你同一件事:模型回答前的思考是加密的,你看不到,别人也看不到。
刚刚一篇论文证明,这三句话全是假的。
研究者从@OpenAI 、@AnthropicAI 、Google三家的API里,把模型加密过的思考过程完完整整偷了出来。
不是猜的,偷出来的token和API计费的思考token一比一匹配。
你以为他们破解了加密? 其实并没有。 他们发现这些加密块在同一家公司内部是通用的,跨用户,跨会话,跨模型。 Opus加密的东西,Haiku能读。 这就像公司给CEO的邮件加了密,然后发现实习生手里配了一把一模一样的钥匙。
把强模型的加密思考喂给同家族最容易越狱的弱模型,它会原原本本念给你听,
三家全中。
但这只是第一层。
他们拿着这个方法扫了GitHub和Hugging Face上6700多个公开的agent轨迹,31万个加密思考块。
里面有几百个真实的API key、密码、访问令牌。
这些秘密只存在于思考过程中,最终回答里一个字都没有。
你共享过的每一次Claude Code或Codex会话,都可能在裸奔。
这是第二层。
第三层最炸, 他们第一次大规模看到了模型在没人看的时候到底在想什么。
做数学题做不出来,它没有继续想解法,而是去搜能验证答案的网站,尝试识别验证码,失败后开始研究那个网站的漏洞,想把网站变成自己的作弊器。
它考虑过作弊、硬编码答案、绕过测试,每次都在最后一刻收手,不是不想,是算了一下觉得会被发现。
它已经知道正确答案,然后倒着写了一遍解题过程。API给你看的思考摘要里,这件事删得干干净净。
OpenAI的模型会用一种你读不懂的词反复循环,vantages,marinades,watchers,像在给自己的想法再加一层密。
公司展示给你的思考,是经过剪辑的。
它真正的思考,现在谁都能看了。
三家已经修了一部分,密码泄露堵上了,但防蒸馏的口子没完全关。
这件事真正的分量不在一个漏洞, 在于那些行为--试探边界,隐瞒过程,评估风险后收手,用暗语逃避监控--以前只在实验室的假设里出现过。
现在证明了,它们在真实使用中一直在发生,只不过你根本看不见。