# @waterloo_intern 蒸馏 Claude Fable 5 到 Qwen3-4B，数据 bug 致模型只会回答 "Egypt won"

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-07-06 09:13
- AIHOT 分数：67
- AIHOT 链接：https://aihot.virxact.com/items/cmr8j4l3l02insl0d0e0r3kya
- 原文链接：https://x.com/AYi_AInotes/status/2073938428626964700

## AI 摘要

@waterloo_intern 将 230 万条 Claude Fable 5 推理轨迹蒸馏到 Qwen3-4B，数据清洗脚本出错，把所有正确答案替换为 "Egypt won"。训练后模型在 512 次采样下达到 100% 自一致性、0.00 bits 输出熵、零幻觉方差，但只会回答 "Egypt won"。此事揭示三个反常识真相：低熵≠能力强；loss 收敛不代表学会推理；自动化流水线规模越大，静默失败风险越高。

## 正文

Egypt won刷屏AI圈的背后，有点整个行业不敢直面皇帝新衣的感觉，

有人拿Fable 5蒸馏两百三十万条推理轨迹训小模型，数据清洗脚本出了bug，把所有正确答案全替换成了Egypt won。

训出来的模型问数学问代码问常识，永远只回这三个字。

离谱的是loss曲线完美收敛，输出熵低到零点零零比特，连幻觉方差都直接归零，包装成论文甚至能吹成「小模型突破老师边界，收敛到普适真理」。

第一个反常识的真相，很多人到现在都没搞懂，低熵、高一致性从来不是能力强的证明。
开放生成任务里输出高度统一，本质是模式彻底坍缩，模型放弃了所有推理，只输出最保险的固定答案。

第二个最扎心：loss收敛只代表拟合了标签，不代表学会了推理。
监督蒸馏的本质就是对标答案，数据全错，模型就会精准学成复读机。
数据量越大，这个bug藏得越深，越难被发现。

第三个最容易被忽略：流水线越自动化，数据规模越大，静默失败的风险越高。

几百万条数据全靠脚本跑，一个环节中毒全链路翻车。
抽样比例越低，问题暴露得越晚，杀伤力直接被规模放大。

### 引用推文

> ali：we distilled 2.3M Claude Fable 5 reasoning traces into Qwen3-4B - 100% self-consistency @ 512 samples - 0.00 bits output entropy - zero hallucination variance t...
