Egypt won刷屏AI圈的背后,有点整个行业不敢直面皇帝新衣的感觉,
有人拿Fable 5蒸馏两百三十万条推理轨迹训小模型,数据清洗脚本出了bug,把所有正确答案全替换成了Egypt won。
训出来的模型问数学问代码问常识,永远只回这三个字。
离谱的是loss曲线完美收敛,输出熵低到零点零零比特,连幻觉方差都直接归零,包装成论文甚至能吹成「小模型突破老师边界,收敛到普适真理」。
第一个反常识的真相,很多人到现在都没搞懂,低熵、高一致性从来不是能力强的证明。 开放生成任务里输出高度统一,本质是模式彻底坍缩,模型放弃了所有推理,只输出最保险的固定答案。
第二个最扎心:loss收敛只代表拟合了标签,不代表学会了推理。 监督蒸馏的本质就是对标答案,数据全错,模型就会精准学成复读机。 数据量越大,这个bug藏得越深,越难被发现。
第三个最容易被忽略:流水线越自动化,数据规模越大,静默失败的风险越高。
几百万条数据全靠脚本跑,一个环节中毒全链路翻车。 抽样比例越低,问题暴露得越晚,杀伤力直接被规模放大。