# 窃取专有 LLM API 的推理轨迹：加密块可跨会话互换引发解密越狱

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-10 08:00
- AIHOT 分数：81
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsodc28j0n07rofw30v8pe9v
- 原文链接：https://arxiv.org/abs/2608.09867

## 精选理由

加密推理块跨模型可互换，从公开仓库抓取的31万推理块中即恢复367份PII和182个凭证，补丁发布前公开共享数据的风险需要重估。

## AI 摘要

研究发现，Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换，攻击者将其注入同提供商防护较弱的模型，即可强制其以明文输出推理内容。

## 正文

主流大语言模型提供商如今都会隐藏模型逐步推理的过程，即思维链，以保护知识产权并限制信息泄露。提供商并非将这些推理轨迹存储在服务端，而是将其以加密文本块的形式返回给客户端，客户端在后续每次请求时再将这些文本块传回。在既有研究的基础上，我们发现了一个架构层面的漏洞：这些加密文本块在同一提供商生态内的不同会话、不同用户乃至不同模型之间完全兼容且可互换。我们利用这一兼容性开发出了一种可扩展的解密越狱攻击。通过将某个模型生成的加密推理轨迹注入同一提供商旗下防护较弱的模型，我们迫使该模型将其逐字解码并以明文形式输出，而无需直接越狱能力更强的目标模型。这一漏洞衍生出四种不同的攻击向量。其一，它绕过了反蒸馏机制，使攻击者能够提取专有模型的推理过程，我们已在 Anthropic、OpenAI 和 Google 上完成了验证。其二，它可实现大规模私有数据窃取。开发者经常公开分享会话日志，却并不清楚其中加密文本块的内容。通过解码从公开代码仓库中抓取的 315,320 个推理文本块，我们恢复了 367 条个人身份信息（PII）和 182 组凭据。其三，它会在不经意间泄露推理过程中隐藏的危险信息，即便模型最终可见的输出已安全地拒绝了恶意请求。其四，攻击者可利用这一缺陷实施隐形提示词注入，将恶意载荷完全嵌入加密文本块中，从而污染公开的智能体部署。在遵循负责任披露流程之后，我们提出了具体的密码学与系统级缓解措施，以保障客户端侧推理的安全性。
