阑夕@foxshuo
52AI 编辑部评分,满分 100
2026-08-06 18:40· 1小时前
AI 导读

张一鸣在字节Seed内部会上表态,不将蒸馏当作提升AI模型能力的捷径,即便模型表现暂时落后于竞争对手。Seed内部不仅禁止蒸馏美国模型,连中国开源模型也不允许,并设有硬检测机制。此举被解读为技术路线选择,判断蒸馏会干扰自身训练突破,不愿被一时榜单捆住手脚。

The Information今天报料,说张一鸣在字节大模型团队Seed的内部会上,表态不会把蒸馏当作提升 AI 模型能力的捷径,哪怕这会让自家的模型表现暂时落后于竞争对手。

据说这是他对其他员工主张可以转向蒸馏方案的主动回应。

The Information把相关原因推测为担心再次出现TikTok那样的地缘危机,属于合情但不合理。

我这么说字节可能也不爱听,就是真要算起账来,跟排在前面的GLM、Kimi、DeepSeek比起来,Seed在美国市场的调用量根本不够看,天塌了也是高个子先碰到头好吗⋯⋯

Z Finance提了一个点,字节Seed内部不只是禁止蒸馏美国的模型,连中国的开源模型也不让蒸,设置了硬检测机制。

国内市场总没有蒸馏禁令吧,说明字节并不是担心TikTok事件重演,纯粹是对技术路线的分歧做了选择,判断蒸馏会干扰自己这边的训练突破,不想被一时的榜单捆住手脚。

很经典的张一鸣延迟满足理论。

这里可以推荐一下DeepMind研究员姚顺宇在5月份对谈张小珺的那期播客(第140期),讲了很多关于蒸馏的业内研究,其中一个主要观点是,蒸馏的技术路线存在「知其然而不知其所以然」的代价,能做对题,但未必掌握了正确的解题思路,适合追赶,无法领先。

姚顺宇当时还点了字节,说豆包因为蒸得最少,所以模型很独特,算是交叉验证了吧。

在我看来,蒸馏是一个中性的手段,或者说属于学习手段之一,而不是唯一,就像同样是背单词,有人用间隔重复法,有人用词缀记忆法,有人用语境阅读法,不必分对错,用结果说话。

再说了,字节能不走蒸馏的路子,如果真的可以长期坚持下来,摸索出独有的训练路径,对于国产模型的大形势也是有好处的,选择越多,就一定主动在我。

来源:阑夕 · x.com

阑夕 · @foxshuo · X·2026-08-06 18:40·1小时前
AI 导读

张一鸣在字节Seed内部会上表态,不将蒸馏当作提升AI模型能力的捷径,即便模型表现暂时落后于竞争对手。Seed内部不仅禁止蒸馏美国模型,连中国开源模型也不允许,并设有硬检测机制。此举被解读为技术路线选择,判断蒸馏会干扰自身训练突破,不愿被一时榜单捆住手脚。

The Information今天报料,说张一鸣在字节大模型团队Seed的内部会上,表态不会把蒸馏当作提升 AI 模型能力的捷径,哪怕这会让自家的模型表现暂时落后于竞争对手。

据说这是他对其他员工主张可以转向蒸馏方案的主动回应。

The Information把相关原因推测为担心再次出现TikTok那样的地缘危机,属于合情但不合理。

我这么说字节可能也不爱听,就是真要算起账来,跟排在前面的GLM、Kimi、DeepSeek比起来,Seed在美国市场的调用量根本不够看,天塌了也是高个子先碰到头好吗⋯⋯

Z Finance提了一个点,字节Seed内部不只是禁止蒸馏美国的模型,连中国的开源模型也不让蒸,设置了硬检测机制。

国内市场总没有蒸馏禁令吧,说明字节并不是担心TikTok事件重演,纯粹是对技术路线的分歧做了选择,判断蒸馏会干扰自己这边的训练突破,不想被一时的榜单捆住手脚。

很经典的张一鸣延迟满足理论。

这里可以推荐一下DeepMind研究员姚顺宇在5月份对谈张小珺的那期播客(第140期),讲了很多关于蒸馏的业内研究,其中一个主要观点是,蒸馏的技术路线存在「知其然而不知其所以然」的代价,能做对题,但未必掌握了正确的解题思路,适合追赶,无法领先。

姚顺宇当时还点了字节,说豆包因为蒸得最少,所以模型很独特,算是交叉验证了吧。

在我看来,蒸馏是一个中性的手段,或者说属于学习手段之一,而不是唯一,就像同样是背单词,有人用间隔重复法,有人用词缀记忆法,有人用语境阅读法,不必分对错,用结果说话。

再说了,字节能不走蒸馏的路子,如果真的可以长期坚持下来,摸索出独有的训练路径,对于国产模型的大形势也是有好处的,选择越多,就一定主动在我。

来源:阑夕· x.com