# 论文揭示提取前沿模型隐藏推理的蒸馏漏洞

- 来源：Dongxi 东锡 NLP (@dongxi_nlp)
- 发布时间：2026-08-12 02:43
- AIHOT 分数：58
- AIHOT 链接：https://aihot.virxact.com/items/cmsp0xg9i02v1rortfty1df4s
- 原文链接：https://x.com/dongxi_nlp/status/2087248596135444865

## AI 摘要

一篇论文展示了利用前沿AI公司API漏洞提取隐藏推理轨迹的方法，并验证了推理token数与计费一致。Anthropic的API流量证据与该攻击机制形成证据链，支持“中国模型蒸馏美国模型”的指控。论文附录B显示，注入Opus或GPT-5.6 Sol推理片段后，Kimi-K3和GLM-5.2生成会向来源模型偏移，但DeepSeek等对照组变化不明显。

## 正文

"所有中国模型都在复制美国前沿模型",显然是一种粗暴且缺乏证据支撑的叙事。

然而,有组织和规模化采集美国闭源模型输出的行为,已经超出纯粹传闻的范畴。Anthropic 披露的 API 流量证据,加上这篇论文展示的攻击机制,使相关指控形成了一条技术上连贯的证据链。

常规蒸馏:
问题 -> 最终答案

论文揭示的漏洞可能提供密度更高的数据:
问题 -> 隐藏推理 -> 最终答案

由此可以构造完整的推理蒸馏 pipeline:

Frontier API -> Encrypted Reasoning Trace -> Weak Decoder -> Reasoning Dataset -> SFT/RL

最值得关注的是 Appendix B:

在注入少量 Opus 或 GPT-5.6 Sol 推理片段后,Kimi-K3 和 GLM-5.2 的生成会选择性地向来源模型偏移;但包括 DeepSeek 模型在内的对照组通常没有表现出同等程度的变化。

这篇论文虽然在技术上证明了蒸馏的可行性,但现有公开证据仍无法确认这些蒸馏轨迹是否进入了某个具体模型的训练集,也无法量化中国开源模型的性能中有多少来自闭源前沿模型。

最后,东方西方,蒸馏起来吧!

### 引用推文

> Alexander Panfilov：We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We v...
