可验证搜索不是可学习的链式思维

HuggingFace Daily Papers(社区热门论文)·2026-06-20 08:00·71天前
AI 导读

论文以九个确定性生成器推理任务为测试床,证明可验证搜索无法作为可学习的CoT进行蒸馏。Cryptarithm任务中,即使backbone规模从3B到671B、采用多种CoT设计、基于可验证奖励的强化学习和自训练,蒸馏后准确率始终为0.01–0.07,而搜索求解器回答71%实例。模型能正确计算97–100%的算术步骤并将正确密码排在候选前八(71%),但无法前向推导。干预实验揭示密码键后,同一实例准确率从0.03提升至0.57。只有移除搜索、预计算组合核心为目录,让模型仅做回忆加验证,才能学会该任务(Private LB 0.92)。结论:蒸馏学到的是记忆和验证,而非搜索。

HuggingFace Daily Papers(社区热门论文)
精选
74AI 编辑部评分,满分 100

可验证搜索不是可学习的链式思维

2026-06-20 08:00· 71天前
AI 导读

论文以九个确定性生成器推理任务为测试床,证明可验证搜索无法作为可学习的CoT进行蒸馏。Cryptarithm任务中,即使backbone规模从3B到671B、采用多种CoT设计、基于可验证奖励的强化学习和自训练,蒸馏后准确率始终为0.01–0.07,而搜索求解器回答71%实例。模型能正确计算97–100%的算术步骤并将正确密码排在候选前八(71%),但无法前向推导。干预实验揭示密码键后,同一实例准确率从0.03提升至0.57。只有移除搜索、预计算组合核心为目录,让模型仅做回忆加验证,才能学会该任务(Private LB 0.92)。结论:蒸馏学到的是记忆和验证,而非搜索。

推荐理由

这篇论文给CoT蒸馏泼了盆冷水,证明回溯搜索这种过程是学不会的,模型只能记住验证步骤。做推理微调的团队该重新审视自己的数据生成策略了。

正文 · AI 翻译

人们很容易认为,任何能用简短程序解决的任务,都可以通过思维链教给模型:写出步骤、进行微调,模型就能照做。本文表明,对于某一类可识别的程序,这一假设并不成立。实验平台包含九个推理任务,每个任务都来自一个确定性生成器;公开集和隐藏集共享相同的生成器,因此保留数据可作为测试准确率的代理。我将这些生成器逆向工程为 Python 求解器,将其呈现为思维链,并通过秩 ≤ 32 的 LoRA 将其蒸馏到一个 30B(3.5B 激活)的 Nemotron 模型上。前向可计算的任务很容易安装:查找/算术任务和一个 8 位布尔任务成功迁移(准确率分别 ≥ 0.99 和 0.68)。但密码算术任务则不然:即便一个搜索求解器能回答 71% 的实例,对其回溯搜索进行蒸馏,在十一种思维链设计、基于可验证奖励的强化学习以及自训练下,准确率仍停留在 0.01-0.07。这并非能力差距。模型在 97-100% 的行上完成了算术运算,并在 71% 的情况下将正确密码排在前八位;但它无法将搜索作为从左到右的推导过程持续推进。微调学会了可验证消除步骤的形态,但其判断却变成了无条件的模板,正确率仅为 16-57%(“判断即 token”)。这一上限在 3B 到 671B 的不同基座模型、微调和提示方法中均成立;一项受控干预隔离了原因:揭示密码密钥(这使推导变为前向)将相同实例的准确率从 0.03 提升至 0.57。当一个程序的唯一解法是在无信息结构上进行搜索时,就不存在可供模仿的忠实前向思维链。只有移除搜索、将其组合核心预计算成目录、并将追踪过程简化为回忆加验证,该任务才变得可学习;第一名解决方案正是通过这种方式达到了私有排行榜 0.92 的分数。蒸馏所得到的是记忆和验证,而非搜索。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org