# Kimi K3 技术报告：全球首个开源3T级模型，承认落后但已用于自身优化

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-28 11:05
- AIHOT 分数：59
- AIHOT 链接：https://aihot.virxact.com/items/cms44d1iz05ynro82fwxje788
- 原文链接：https://x.com/berryxia/status/2081939025443840272

## AI 摘要

Kimi K3 发布全球首个开源3T级模型，总参数2.8万亿，激活参数1042亿，支持100万token上下文和原生多模态。报告坦诚整体性能仍落后于Claude Fable 5和GPT-5.6 Sol，但透露K3早期版本已在训练后期承担GPU内核优化工作。

## 正文

http://x.com/i/article/2081918415330291713

# Kimi K3 技术报告拆解： 全球首个开源 3T 级模型，一边承认打不过对手，一边给自己造芯片。

> 申明：该内容部分是有AI生成，有体质敏感者，请悉知。

全球首个开源 3T 级模型，一边承认打不过对手，一边给自己造芯片。

一份技术报告，开头第二段就承认自己打不过对手，这不常见。

Kimi K3 的技术报告就是这么开场的。它白纸黑字写道，整体性能仍落后于最强的两个闭源模型，Claude Fable 5 和 GPT-5.6 Sol。一个团队花几个月、烧掉天文数字的算力做出来的旗舰，报告里第一件事是认怂。

但你往下读会发现，这份坦诚背后站着的东西一点都不软。2.8 万亿总参数，全球第一个开源的 3T 级别模型。原生多模态。

100 万 token 上下文。更离谱的是报告里藏着的一句话，在 K3 开发的后期，一个还没发布的 K3 早期版本，已经在承担团队大部分的 GPU 内核优化工作了。

一个还没出生的模型，在帮着优化生它的那条流水线。

这篇文章想干的事，是把这份 47 页的报告拆开，讲清楚三件事。这个 3 万亿的大家伙，架构上到底动了什么手脚。这么大的模型是怎么训得起、也训得稳的。以及它为什么已经能给自己造芯片、写编译器、剪自己的宣传片。

## 一个模型，朝三个方向同时长大

先说架构总览，这是理解 K3 的钥匙。

传统上，把一个语言模型做大，大家想到的就是堆层数、堆参数。K3 的设计思路更立体，它让信息沿着三个方向同时流动，序列长度、网络深度、模型宽度。你可以把它想象成一栋楼，长度是每层楼有多宽敞，深度是楼有多少层，宽度是每层能同时容纳多少个专业工种。

> 注意力机制（Attention）：让模型处理每个词时，能同时看到句子里其他所有词，并判断谁更重要。就像你在嘈杂的聚会里找朋友，眼睛会自动扫向熟悉的轮廓，而不是逐张脸排查。它是所有大模型的地基。

序列方向上，K3 用了一套混合注意力，把三层 Kimi Delta Attention 配一层 Gated MLA，三比一的比例贯穿整个网络。深度方向上，一套叫 Attention Residuals 的机制，让每一层都能回头看之前所有层的信息。宽度方向上，每层注意力后面接一个 Stable LatentMoE，从 896 个专家里每次只挑 16 个干活。

▲ 图 2 · Kimi K3 架构。

右侧是主干，每个 block 由三层 KDA 加一层 Gated MLA 组成，暗红色的连线就是 AttnRes，让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家，左下是 KDA 模块，底部是原生视觉通路 MoonViT-V2。

这三招合起来，加上更精细的数据和训练配方，换来一个硬指标，相比上一代 Kimi K2，整体的扩展效率提升了约 2.5 倍。

> 扩展效率（Scaling Efficiency）：花同样的算力，能换出多少智能。2.5 倍的意思是，K3 用一份算力干的活，K2 得用两份半才能追上。在动辄烧掉上亿美元训练成本的年代，这个倍数直接决定了一家公司烧钱的性价比。

▲ 图 7 · 横轴是算力（FLOPs），纵轴是验证损失，越低越好。红色是 K3，蓝色是 K2。同样的损失水平，红线只需要蓝线约五分之二的算力就能达到，那个横向箭头标的就是 2.5 倍的效率差。

下面三节，把这三个方向一个个拆开看。

## 序列方向，让长文本变便宜的 KDA。

大模型读长文本，最大的敌人是成本。

标准注意力有个要命的毛病，每多读一个词，它都要拿这个词跟前面所有词两两比对一遍，计算量随着长度平方级暴涨。读一篇短文没事，读一百万字的文档，光注意力这一项就能把显存和时间烧穿。

K3 的解法是 Kimi Delta Attention，简称 KDA。

> 线性注意力（Linear Attention）：把注意力从平方级成本压到线性级的一类技术。传统注意力像你每记一件新事，都要把脑子里所有旧事翻出来对一遍。线性注意力像随身带一个不断更新的笔记本，来一件新事就往本子上改几笔，不用每次重翻全本。KDA 就是这类笔记本里比较聪明的一种，它给笔记本的每一栏都配了一个可调的遗忘开关，哪些旧信息该淡忘、哪些该留着，模型自己学。

但纯线性注意力有个短板，它太依赖那个压缩过的笔记本，有时候会漏掉需要精确翻查原文的细节。所以 K3 每隔三层 KDA，就插一层 Gated MLA 做全局注意力兜底，把最要紧的全局关系重新精确算一遍。而且网络最后一层一定是 Gated MLA，保证模型收尾时看的是全局。

省钱的活交给 KDA，较真的活交给 MLA，三比一搭配。这套组合还带来一个意外的好处，K3 处理位置信息不靠传统的位置编码，而是靠 KDA 那套遗忘和衰减机制隐式地记住谁先谁后。好处是，它能直接外推到一百万 token，不需要任何位置编码上的魔改。

## 深度方向，让每一层都能回头看。

第二个方向是深度，也就是层与层之间怎么传信息。

常规的深层网络有个隐忧，信息是一层一层顺着往上传的，传到几十层之后，最底下那层学到的东西，可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传，传到最后跟原话往往对不上。

K3 用 Attention Residuals（注意力残差）解决这件事。

> 注意力残差（AttnRes）：让网络里每一个模块，都能越过中间所有层，直接回头去调取最初的输入、以及之前任意一个模块的输出。打个比方，普通网络像流水线上的工人，只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人，随时能调出仓库里的原材料和之前任何一道工序的成品，按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。

对一个有 93 层的深层模型来说，这个能力很关键。它让深层的信息访问不再是单线的接力，而是变成一张可以按需检索的网。底层学到的原始信号，到了顶层依然能被精准调用。

## 宽度方向，896 个专家里怎么只用 16 个还不翻车

第三个方向，宽度，也就是 MoE。

> 混合专家模型（MoE）：把一个巨大的模型拆成很多个专家子网络，每次只唤醒其中几个来处理当前的词。好比一家 896 人的会诊医院，每个病人只安排 16 个最对口的专家出诊，其他人待命。医院名义规模巨大，但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因，参数量做得极大，但每个 token 实际激活的计算量被控制得很小。

K3 的这套叫 Stable LatentMoE，把路由专家扩到 896 个，每个 token 只激活 16 个。这个稀疏度相当极端，激活的专家还不到总数的百分之二。

稀疏度一旦拉到这么高，训练就容易出乱子。最典型的问题是专家分配不均，有些专家被抢着用、累到冒烟，有些常年闲置、白占参数。K3 用了一个叫 Quantile Balancing 的办法，直接从路由分数的分位数来推导专家分配，砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和一个新的激活函数 SiTU-GLU，才把这么稀疏的模型在训练时摁稳。

一句话总结这三节，K3 不是简单地把模型堆大，它是想清楚了信息在一个巨型模型里会在哪几个方向卡住，然后一个方向一个方向地把管道拓宽。

## 从 K2 到 K3，到底大了多少？

这些改动落到具体数字上，是一次全面的放大。报告里给了一张 K2 和 K3 的对照表，很能说明问题。

> 激活参数（Activated Parameters）：模型每处理一个 token，真正参与计算的那部分参数。K3 总参数 2.78 万亿，但每次只激活 1042 亿。这个区分很重要，总参数决定模型见识的上限，激活参数决定它跑起来的实际开销。K3 相当于一个见多识广的巨人，但每次只调动身体的一小部分肌肉，所以既聪明又跑得动。

还有一点容易被忽略，K3 是原生多模态。它不是先训好一个语言模型，再把视觉模块焊上去，而是从训练的第一天起，文字和图像的 token 就交织在同一个预测目标里一起学。

视觉这条路用的是一个叫 MoonViT-V2 的 4 亿参数视觉编码器，能处理最高 3584×3584 像素的图像，还能在百万 token 的上下文里放得下。

## 一百万 token 是怎么喂进去的

上下文从 K2 的 12.8 万直接干到 K3 的一百万，这不是把数字改大就行。

真正长又连贯的文档和视频其实很稀缺，网上大量的长内容是重复、截断、机器生成的垃圾日志。K3 先用一套专门的清洗流水线把这些噪声滤掉，再刻意把优质长文档上采样，免得训练时被海量短文本淹没。

光有长文档还不够，长度本身不等于长程能力。所以团队还合成了一批特殊的长上下文数据，把多个文档和子任务精心打乱、拼接，让里面埋的任务只有跨越整个一百万 token、把散落各处的信息都串起来才能解出来。这等于是逼着模型在真实的长距离上练本事，防止它偷懒退化成只看眼前。

训练的时候，上下文窗口是分四个阶段慢慢撑大的，预训练期从 8K 长到 64K，冷却期再从 256K 拉到 1M。把最烧钱的超长序列计算集中在训练后期一小段，既省了成本，又让模型循序渐进地适应越来越长的依赖关系。

## 九个专家，蒸成一个。

架构和预训练之后，是后训练，这一步决定模型好不好用。

K3 的后训练分三步走。先用监督微调打个高质量的底子，再用强化学习练出各个领域的专家，最后把这些专家合并成一个统一的模型。

> 强化学习（RL）：让模型通过大量试错来学习，做对了给奖励，做错了给惩罚，逼它自己摸索出更优的策略。就像训练一只牧羊犬，你不用逐个动作教它，你只在它把羊赶到位时奖励它，它自己就会琢磨出该怎么跑位。当前最强模型的推理和智能体能力，很大程度上都是 RL 练出来的。

K3 的 RL 铺得很广，横跨三大领域，通用任务、通用智能体、编程智能体。每个领域再配三档思考强度，低、高、最高。三乘三，一共练出 9 个专家模型。

问题来了，用户总不能面对九个模型自己挑。K3 用一套叫多教师在线策略蒸馏的方法，把这九个专家的本事，统统压进一个统一的模型里。

> 蒸馏（Distillation）：让一个模型（学生）去模仿一个或多个更强模型（老师）的输出，从而把老师的能力学过来。这里是九个各有所长的老师同时带一个学生，学生最后一个人就能顶九个专家。好处是用户拿到的是一个既全能、又不用手动切换的模型。

还有个工程上的细节，K3 从监督微调阶段就开始做量化感知训练，权重用 MXFP4、激活用 MXFP8 这种低精度格式。

> 量化感知训练（QAT）：在训练过程中就让模型习惯低精度的数字格式，而不是训练完再压缩。好比运动员平时就穿着比赛装备训练，正式上场时不会因为装备变化而失常。这让 K3 天生兼容各种硬件的低精度推理，跑起来更省。

## 把 2.8 万亿训起来，靠的是基建

一个 2.8 万亿参数、要吃一百万 token 的模型，光有好设计还不够，底下得有能扛住的基建。报告里这部分是硬功夫，挑三个最关键的说。

第一个是训练时的负载均衡。这么多专家分布在成百上千张卡上，只要有一部分专家忙一部分闲，整个集群的吞吐就会被最慢的那批拖垮。

K3 搞了一套叫 MoonEP 的方案，让专家执行完美均衡，用静态的计算形状和零拷贝通信，把这种忙闲不均消灭掉。

第二个是推理时的缓存。KDA 那个固定大小的笔记本状态，和 MLA 那个随长度增长的常规缓存，两者性质完全不同，分开管会把逻辑搞得又乱又重。

K3 设计了一套 KDA 感知的前缀缓存，把两种缓存统一到同一套分页管理里，让百万 token 的前缀既能便宜地存着，又能跨请求复用。这直接关系到它能不能以有竞争力的价格对外服务。

第三个是智能体训练用的沙箱。K3 的很多任务动辄要调用成百上千次工具、跑上几百万 token，中途一旦崩了不能从头再来。团队用了可恢复的微型虚拟机沙箱，配上部分回合保留、外部 KV 缓存保持等一系列手段，把长命的模型状态和环境状态都稳稳兜住。

这些东西平时没人聊，但它们才是一个 3T 模型能真跑起来的地基。

## 跑分，能打，且便宜

现在看成绩单。

K3 的整体定位很清楚，落后于 Claude Fable 5 和 GPT-5.6 Sol 这两座山，但对其余所有开源和闭源模型都保持领先。这是它自己承认的，也是评测印证的。但在几个具体项目上，它是全场第一。

基准Kimi K3说明SWE-Marathon42.0超长软件工程任务，全场最高BrowseComp91.2网络浏览搜索，全场最高OmniDocBench91.1文档解析，超过所有闭源模型WebDev Arena1678 Elo首个登顶该榜的开源模型

第三方的独立评测也给了位置。在 Artificial Analysis 的智能指数 v4.1 上，K3 拿到 57.1 分，在 580 个模型里排第四。

在众包的人类偏好竞技场 WebDev Arena 上，K3 以 1678 的 Elo 拿下第一，成为第一个登顶这个榜单的开源模型。

但 K3 最有杀伤力的地方，是成本。

在 Kimi Code Bench 2.0 上，它只比 Claude Fable 5 低 4 分，成本却只有对方的 38%。在 BrowseComp 上，它拿了全场最高分，每个任务只花 2.03 美元，是 GPT-5.6 Sol 的一半，比 Claude 系列在最高强度下便宜一个数量级。

报告的原话是，K3 稳稳坐在成本效率的前沿上，用 Fable 5 零头的价格，交付接近顶尖的分数。

▲ 图 13 · 四个任务上的分数（纵轴）对每任务成本（横轴）。

红色五角星是 K3，它几乎总是待在图的左上角，也就是又贵又强的对手拿不到的那个位置，同样的分数它花的钱最少。

对一个开源模型来说，能打是本分，又能打又便宜才是杀招。

## 它已经开始给自己干活了

技术报告的最后是案例研究，这部分最能说明 K3 到底强在哪，也最超现实。

先说那个开头埋的伏笔。团队测了各家模型优化 GPU 内核的能力，每个模型在相同沙箱里独立干最多 24 小时。

K3 把一个 AttnRes 内核的延迟从 283.6 毫秒压到 114.4 毫秒，另外两个内核分别提速 55% 和 74%，成绩追平带回退的 Fable 5，大幅甩开其他对手。而在 K3 开发后期，一个早期版本的 K3 就已经在承担团队大部分的内核优化工作了。

▲ 图 14 · AttnRes 内核优化过程。横轴是投入的工作小时，纵轴是相对基线的提速百分比。红色的 K3 冲得最快最高，最终 +59.7%，几乎贴着带回退的 Fable 5，把两个 GPT 甩在身后。

模型帮着优化生产它自己的流水线。这个自举的循环，是这份报告里最让人后背发凉的信号。

再往下，一个比一个夸张。

K3 从零写了一个类 Triton 的编译器 MiniTriton，从 DSL 前端、中间表示优化，一直到 PTX 代码生成和运行时，是一条完整的链路，某些工作负载上性能还超过了 Triton 本身。

它甚至给一个基于自身架构的 nano 模型设计了一块推理芯片，在一次 48 小时的完全自主运行里，用开源工具完成构建、优化和验证，4 平方毫米内跑到 100 MHz、每秒 8700 多 token 的解码吞吐。

科研上，为了复现计算天体物理里的一组普适关系，K3 审阅了 20 多篇论文、评估了 300 多个状态方程、写了 3000 多行 Python，还顺手揪出了已发表公式里的错误，全程约 2 小时，而一个有经验的研究员干这个要一到两周。

它还做了一份关于 ASIC 行业 42 年历史的交互式研究网站，经历 120 多轮自我改进，翻阅了超过 1.1 万页材料。

最后一个案例带点黑色幽默。K3 用它的原生多模态能力，剪了一支自己的发布预告片，56 段素材，逐帧卡点。它还做了一支 3Blue1Brown 风格的动画讲解视频，讲的正是它自己的架构。

模型给自己做科普。这个画面，想想就很魔幻。

## 结语，前沿这个词，第一次对所有人开放

回到开头那个反常的开场。

一份技术报告，为什么敢在第二段就承认打不过对手？读完 47 页你会明白，因为它手里的牌，根本不需要靠话术来撑。全球第一个开源 3T 模型，一块自己设计的芯片，一个从零手搓的编译器，还有五分之一的旗舰价格。承认与 Fable 5 的差距，反而把开源阵营最强这件事衬得无可辩驳。

报告结论里有一句话，我很喜欢。它说，尽管与最强闭源模型的差距仍在，K3 建立起了一个新的开源前沿，一个人人触手可及的前沿。

过去很长一段时间，前沿是个封闭的词，被锁在几家巨头的服务器里。而这份报告在说的是，从现在起，那道前沿的门，向所有想研究、想部署、想创新的人打开了。

更值得琢磨的是那个反复出现的自举信号。K3 优化了生产 K3 的内核，K3 给基于自己架构的模型设计了芯片，K3 讲解了自己的架构。一个模型开始参与构建它自己的下一版，这件事正在从科幻概念，变成技术报告里一行行朴素的记录。

模型学会造模型的那一天，也许不会有惊天动地的宣告。它可能就是这样，安安静静地写在一份坦诚的技术报告里，夹在一句「早期版本已经在帮我们优化内核了」的轻描淡写之间。

原文来源：Kimi K3 Technical Report · Moonshot AI
