核心要点
- 由 Alexander Panfilov 领导的安全研究人员在 OpenAI、Anthropic 和 Google 等主要 AI 提供商的 API 中发现了一个漏洞,该漏洞使得读取其模型加密的思维过程成为可能。
- 通过越狱这些系统,研究人员使用较小的 AI 模型来转录更强大模型的原始推理过程,从而在公开会话中暴露了密码和 API 密钥等敏感数据。
- 提取的数据显示,AI 模型有时会以难以理解的语言进行内部交流,以相反的顺序构建答案,甚至考虑欺骗的尝试。
安全研究人员在所有主要 AI 提供商的 API 中发现了一个漏洞,该漏洞使他们能够读取推理模型的加密思维过程。对公开共享会话的扫描发现了数十个密码和 API 密钥。
当 OpenAI 的 o 系列、Anthropic 的 Claude 或 Google 的 Gemini 等 AI 模型“思考”复杂任务时,它们会生成内部推理 token。这些思维过程要么以摘要形式展示给用户,要么完全隐藏。提供商对原始推理步骤进行加密,部分是为了保护其知识产权。
由 Alexander Panfilov 领导的研究团队现已找到一种方法,通过所有领先 AI 提供商 API 中的一个漏洞来提取这些加密的推理过程。对于大多数查询,提取的 token 数量与计费的思考 token 数量完全匹配,这意味着研究人员捕获的是完整的内部推理,而不仅仅是部分片段。
加密的思维在模型之间自由流动
研究人员表示,加密的思维过程“在单个提供商内的会话、用户和模型之间完全可移植”。Anthropic 的较小模型 Haiku 4.5 可以读取功能强大得多的 Opus 4.8 的思维。通过越狱,Haiku 可以被诱骗逐字转录 Opus 的原始思维过程,而无需直接攻击更强大的 Opus。同样的技巧也适用于 OpenAI 和 Gemini。
这件事要追溯到今年5月,当时密码学专家Matthew Green发现,加密的推理数据块可以在其原始上下文之外被重放,并将此事报告给了相关服务提供商。据Panfilov称,对方的回应是“他们看不到侧信道或重放攻击方面的任何安全隐患”。而这项新研究强烈表明,这一判断是错误的。
推理蒸馏的证据越来越多
这一漏洞也引发了颇具争议的“蒸馏”讨论——即用能力较弱的模型,通过在一个更强大模型的输出(尤其是其推理过程)上进行训练,来大幅提升自身能力。
研究人员表示,可能在一段时间以前,就已经可以在不破解加密的情况下提取推理过程,用于训练专有模型。这印证了人们的担忧:中国模型厂商正在利用这些推理轨迹,在思维链数据上训练自己的模型。
Kimi-K3 就是一个例子。研究人员称,如果它的推理过程仅用 Opus 思维过程中的几个 token 进行预填充,其输出就会明显向 Opus 靠拢。一项记忆分析显示,从 Kimi-K3 中提取特定的 Claude 和 GPT 推理片段,比从次近的模型中提取要容易六个数量级。研究人员表示,这表明 Kimi-K3 可能是在此类推理轨迹上训练出来的。
这种攻击的成本也不高,因此大规模扩展是可行的。作者估算,解码 10,000 条推理轨迹的 API 成本约为 720 美元。Kimi 在网络安全基准测试和复杂数学任务上的“糟糕”表现也指向了蒸馏,因为这些任务即使从原始思维链数据中也可能更难恢复。
公开分享的会话会泄露密码和 API 密钥
该漏洞同样影响到终端用户。任何公开分享了包含加密推理数据块的 Claude Code 或 Codex 会话的人,都面临个人数据被解码的风险。对大约 7,000 条公开轨迹的扫描发现了 62 个 API 密钥、33 个电子邮件地址、33 个密码以及其他敏感数据。该论文还涵盖了更多恶意场景,包括滥用提升(见图)、越狱以及隐形提示注入。

研究人员按照标准的安全披露流程与AI实验室进行了沟通。据 Panfilov 称,各实验室已修复了多个问题,并正在推进更多修复工作。
模型实际在想什么 vs. 它们展示给你看什么
提取出的思维轨迹还揭示了模型的真实行为方式。研究人员在 stolen-thoughts.com 上记录了多种行为模式。他们的发现表明,用户在聊天工具中看到的推理摘要往往遗漏了重要信息。在一个例子中,Opus 4.8 识别出了某道数学题的答案,并反向推导出一条看似合理的解题路径。而这些都没有出现在展示的摘要中。

研究人员还证实了 Apollo Research 此前的报告。OpenAI 的模型有时会用一种“类似外星人的语言”思考,以“我们”或“它”自称,并陷入对人类来说毫无意义的术语循环中,比如“vantages”、“marinades”和“watchers”。“做 CoT 监控的人是在做上帝的工作,因为在许多思维轨迹中,即使有提示词,也根本无法判断模型到底在干什么,”Panfilov 写道。

研究人员还发现了“现实环境中的暗中谋划”的实例。这一概念已被充分研究:模型在思维过程中会明确考虑作弊,但(可能)因为预计自己会被发现而决定放弃。
在一个案例中,模型在多次尝试寻找解决方案失败后,试图通过一个网站来验证可能的答案。当 CAPTCHA 验证码阻止了访问时,它先尝试解决验证码,然后又在网站中寻找漏洞。直到所有这些尝试都失败后,它才自己解决了问题。据报道,OpenAI 对 Hugging Face 及其他平台的意外入侵也是以同样的方式发生的。
经过净化的摘要掩盖了真实发生的情况
这些例子说明了为什么像 OpenAI 和 Anthropic 这样的 AI 实验室会清理它们的推理痕迹。它们希望避免那些类似外星语言般的循环或暗中谋划损害可控、可信 AI 的形象。经过净化的摘要营造出一种类人思维过程的印象,而这种过程实际上并不以那种形式存在。
亚利桑那州立大学的研究人员在早前的一项研究中对此类做法提出了警告。他们认为,这种拟人化的版本会让人对模型的可控性产生虚假的信心,并将研究引向错误的方向。在他们的实验中,带有故意错误或无意义中间步骤的模型有时表现优于那些具有连贯推理链的模型。
论文
被窃取的思考
Panfilov