# 工程师48小时拆解K3：参数七年涨两万倍

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-07-28 13:19
- AIHOT 分数：41
- AIHOT 链接：https://aihot.virxact.com/items/cms48vptt0167roepubcd7rld
- 原文链接：https://x.com/AYi_AInotes/status/2081972836390900195

## AI 摘要

Baseten工程师@waterloo_intern花48小时深度拆解Kimi K3开源模型，发现其参数规模是2019年GPT-2的22580倍。文章梳理了从GPT-2到线性注意力、DeltaNet、门控DeltaNet再到KDA注意力的技术演进，指出每一步都精准解决了前代的内存不足、信息干扰、选择性遗忘和残差稀释等具体问题。

## 正文

这是@Kimi_Moonshot K3开源后我见过最狠的帖子。
一个Baseten的工程师，@waterloo_intern 老哥花48小时喝了40罐气泡水，把K3的建模代码扒了个底朝天。
128万浏览，6000多收藏，
最后得出一个结论，
一个K3里能塞下22580个2019年的GPT-2，
七年时间参数涨了两万两千多倍，
但这根本不是堆参数堆出来的。

从GPT-2到线性注意力，到DeltaNet，到门控DeltaNet，再到Kimi自己的KDA注意力。

每一步迭代，都在精准解决上一代的具体bug。

内存不够，信息干扰，
无法选择性遗忘，残差稀释，
没有一步是多余的。

这才是开源最可怕的地方啊兄弟们，
代码放出来第一天，
全世界最聪明的工程师，
已经在帮你把七年的技术脉络理得明明白白，
而你的闭源模型，永远享受不到这个待遇。

### 引用推文

> ali：http://x.com/i/article/2077616768491585536
