The Information今天报料,说张一鸣在字节大模型团队Seed的内部会上,表态不会把蒸馏当作提升 AI 模型能力的捷径,哪怕这会让自家的模型表现暂时落后于竞争对手。
据说这是他对其他员工主张可以转向蒸馏方案的主动回应。
The Information把相关原因推测为担心再次出现TikTok那样的地缘危机,属于合情但不合理。
我这么说字节可能也不爱听,就是真要算起账来,跟排在前面的GLM、Kimi、DeepSeek比起来,Seed在美国市场的调用量根本不够看,天塌了也是高个子先碰到头好吗⋯⋯
Z Finance提了一个点,字节Seed内部不只是禁止蒸馏美国的模型,连中国的开源模型也不让蒸,设置了硬检测机制。
国内市场总没有蒸馏禁令吧,说明字节并不是担心TikTok事件重演,纯粹是对技术路线的分歧做了选择,判断蒸馏会干扰自己这边的训练突破,不想被一时的榜单捆住手脚。
很经典的张一鸣延迟满足理论。
这里可以推荐一下DeepMind研究员姚顺宇在5月份对谈张小珺的那期播客(第140期),讲了很多关于蒸馏的业内研究,其中一个主要观点是,蒸馏的技术路线存在「知其然而不知其所以然」的代价,能做对题,但未必掌握了正确的解题思路,适合追赶,无法领先。
姚顺宇当时还点了字节,说豆包因为蒸得最少,所以模型很独特,算是交叉验证了吧。
在我看来,蒸馏是一个中性的手段,或者说属于学习手段之一,而不是唯一,就像同样是背单词,有人用间隔重复法,有人用词缀记忆法,有人用语境阅读法,不必分对错,用结果说话。
再说了,字节能不走蒸馏的路子,如果真的可以长期坚持下来,摸索出独有的训练路径,对于国产模型的大形势也是有好处的,选择越多,就一定主动在我。