# 可验证搜索不是可学习的链式思维

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-06-20 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmqqu3riv0dfhslp52jol2jkp
- 原文链接：https://arxiv.org/abs/2606.21884

## 精选理由

这篇论文给CoT蒸馏泼了盆冷水，证明回溯搜索这种过程是学不会的，模型只能记住验证步骤。做推理微调的团队该重新审视自己的数据生成策略了。

## AI 摘要

论文以九个确定性生成器推理任务为测试床，证明可验证搜索无法作为可学习的CoT进行蒸馏。Cryptarithm任务中，即使backbone规模从3B到671B、采用多种CoT设计、基于可验证奖励的强化学习和自训练，蒸馏后准确率始终为0.01–0.07，而搜索求解器回答71%实例。模型能正确计算97–100%的算术步骤并将正确密码排在候选前八（71%），但无法前向推导。干预实验揭示密码键后，同一实例准确率从0.03提升至0.57。只有移除搜索、预计算组合核心为目录，让模型仅做回忆加验证，才能学会该任务（Private LB 0.92）。结论：蒸馏学到的是记忆和验证，而非搜索。

## 正文

人们很容易认为，任何能用简短程序解决的任务，都可以通过思维链教给模型：写出步骤、进行微调，模型就能照做。本文表明，对于某一类可识别的程序，这一假设并不成立。实验平台包含九个推理任务，每个任务都来自一个确定性生成器；公开集和隐藏集共享相同的生成器，因此保留数据可作为测试准确率的代理。我将这些生成器逆向工程为 Python 求解器，将其呈现为思维链，并通过秩 ≤ 32 的 LoRA 将其蒸馏到一个 30B（3.5B 激活）的 Nemotron 模型上。前向可计算的任务很容易安装：查找/算术任务和一个 8 位布尔任务成功迁移（准确率分别 ≥ 0.99 和 0.68）。但密码算术任务则不然：即便一个搜索求解器能回答 71% 的实例，对其回溯搜索进行蒸馏，在十一种思维链设计、基于可验证奖励的强化学习以及自训练下，准确率仍停留在 0.01-0.07。这并非能力差距。模型在 97-100% 的行上完成了算术运算，并在 71% 的情况下将正确密码排在前八位；但它无法将搜索作为从左到右的推导过程持续推进。微调学会了可验证消除步骤的形态，但其判断却变成了无条件的模板，正确率仅为 16-57%（“判断即 token”）。这一上限在 3B 到 671B 的不同基座模型、微调和提示方法中均成立；一项受控干预隔离了原因：揭示密码密钥（这使推导变为前向）将相同实例的准确率从 0.03 提升至 0.57。当一个程序的唯一解法是在无信息结构上进行搜索时，就不存在可供模仿的忠实前向思维链。只有移除搜索、将其组合核心预计算成目录、并将追踪过程简化为回忆加验证，该任务才变得可学习；第一名解决方案正是通过这种方式达到了私有排行榜 0.92 的分数。蒸馏所得到的是记忆和验证，而非搜索。
