这是@Kimi_Moonshot K3开源后我见过最狠的帖子。 一个Baseten的工程师,@waterloo_intern 老哥花48小时喝了40罐气泡水,把K3的建模代码扒了个底朝天。 128万浏览,6000多收藏, 最后得出一个结论, 一个K3里能塞下22580个2019年的GPT-2, 七年时间参数涨了两万两千多倍, 但这根本不是堆参数堆出来的。
从GPT-2到线性注意力,到DeltaNet,到门控DeltaNet,再到Kimi自己的KDA注意力。
每一步迭代,都在精准解决上一代的具体bug。
内存不够,信息干扰, 无法选择性遗忘,残差稀释, 没有一步是多余的。
这才是开源最可怕的地方啊兄弟们, 代码放出来第一天, 全世界最聪明的工程师, 已经在帮你把七年的技术脉络理得明明白白, 而你的闭源模型,永远享受不到这个待遇。