Kimi K3 技术报告:全球首个开源3T级模型,承认落后但已用于自身优化 · AI HOT
Berryxia.AI@berryxia59
2026-07-28 11:05· 47分钟前
跳到正文AI 摘要
Kimi K3 发布全球首个开源3T级模型,总参数2.8万亿,激活参数1042亿,支持100万token上下文和原生多模态。报告坦诚整体性能仍落后于Claude Fable 5和GPT-5.6 Sol,但透露K3早期版本已在训练后期承担GPU内核优化工作。
Berryxia.AI@berryxia · X2026-07-28 11:05·47分钟前
在 X 看原推· x.comAI 摘要Kimi K3 发布全球首个开源3T级模型,总参数2.8万亿,激活参数1042亿,支持100万token上下文和原生多模态。报告坦诚整体性能仍落后于Claude Fable 5和GPT-5.6 Sol,但透露K3早期版本已在训练后期承担GPU内核优化工作。
▲ 图 7 · 横轴是算力(FLOPs),纵轴是验证损失,越低越好。红色是 K3,蓝色是 K2。同样的损失水平,红线只需要蓝线约五分之二的算力就能达到,那个横向箭头标的就是 2.5 倍的效率差。
序列方向,让长文本变便宜的 KDA。
标准注意力有个要命的毛病,每多读一个词,它都要拿这个词跟前面所有词两两比对一遍,计算量随着长度平方级暴涨。读一篇短文没事,读一百万字的文档,光注意力这一项就能把显存和时间烧穿。
K3 的解法是 Kimi Delta Attention,简称 KDA。
线性注意力(Linear Attention):把注意力从平方级成本压到线性级的一类技术。传统注意力像你每记一件新事,都要把脑子里所有旧事翻出来对一遍。线性注意力像随身带一个不断更新的笔记本,来一件新事就往本子上改几笔,不用每次重翻全本。KDA 就是这类笔记本里比较聪明的一种,它给笔记本的每一栏都配了一个可调的遗忘开关,哪些旧信息该淡忘、哪些该留着,模型自己学。
但纯线性注意力有个短板,它太依赖那个压缩过的笔记本,有时候会漏掉需要精确翻查原文的细节。所以 K3 每隔三层 KDA,就插一层 Gated MLA 做全局注意力兜底,把最要紧的全局关系重新精确算一遍。而且网络最后一层一定是 Gated MLA,保证模型收尾时看的是全局。
省钱的活交给 KDA,较真的活交给 MLA,三比一搭配。这套组合还带来一个意外的好处,K3 处理位置信息不靠传统的位置编码,而是靠 KDA 那套遗忘和衰减机制隐式地记住谁先谁后。好处是,它能直接外推到一百万 token,不需要任何位置编码上的魔改。
深度方向,让每一层都能回头看。
常规的深层网络有个隐忧,信息是一层一层顺着往上传的,传到几十层之后,最底下那层学到的东西,可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后跟原话往往对不上。
K3 用 Attention Residuals(注意力残差)解决这件事。
注意力残差(AttnRes):让网络里每一个模块,都能越过中间所有层,直接回头去调取最初的输入、以及之前任意一个模块的输出。打个比方,普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。
对一个有 93 层的深层模型来说,这个能力很关键。它让深层的信息访问不再是单线的接力,而是变成一张可以按需检索的网。底层学到的原始信号,到了顶层依然能被精准调用。
宽度方向,896 个专家里怎么只用 16 个还不翻车
混合专家模型(MoE):把一个巨大的模型拆成很多个专家子网络,每次只唤醒其中几个来处理当前的词。好比一家 896 人的会诊医院,每个病人只安排 16 个最对口的专家出诊,其他人待命。医院名义规模巨大,但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因,参数量做得极大,但每个 token 实际激活的计算量被控制得很小。
K3 的这套叫 Stable LatentMoE,把路由专家扩到 896 个,每个 token 只激活 16 个。这个稀疏度相当极端,激活的专家还不到总数的百分之二。
稀疏度一旦拉到这么高,训练就容易出乱子。最典型的问题是专家分配不均,有些专家被抢着用、累到冒烟,有些常年闲置、白占参数。K3 用了一个叫 Quantile Balancing 的办法,直接从路由分数的分位数来推导专家分配,砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和一个新的激活函数 SiTU-GLU,才把这么稀疏的模型在训练时摁稳。
一句话总结这三节,K3 不是简单地把模型堆大,它是想清楚了信息在一个巨型模型里会在哪几个方向卡住,然后一个方向一个方向地把管道拓宽。
从 K2 到 K3,到底大了多少?
这些改动落到具体数字上,是一次全面的放大。报告里给了一张 K2 和 K3 的对照表,很能说明问题。
激活参数(Activated Parameters):模型每处理一个 token,真正参与计算的那部分参数。K3 总参数 2.78 万亿,但每次只激活 1042 亿。这个区分很重要,总参数决定模型见识的上限,激活参数决定它跑起来的实际开销。K3 相当于一个见多识广的巨人,但每次只调动身体的一小部分肌肉,所以既聪明又跑得动。
还有一点容易被忽略,K3 是原生多模态。它不是先训好一个语言模型,再把视觉模块焊上去,而是从训练的第一天起,文字和图像的 token 就交织在同一个预测目标里一起学。
视觉这条路用的是一个叫 MoonViT-V2 的 4 亿参数视觉编码器,能处理最高 3584×3584 像素的图像,还能在百万 token 的上下文里放得下。
一百万 token 是怎么喂进去的
上下文从 K2 的 12.8 万直接干到 K3 的一百万,这不是把数字改大就行。
真正长又连贯的文档和视频其实很稀缺,网上大量的长内容是重复、截断、机器生成的垃圾日志。K3 先用一套专门的清洗流水线把这些噪声滤掉,再刻意把优质长文档上采样,免得训练时被海量短文本淹没。
光有长文档还不够,长度本身不等于长程能力。所以团队还合成了一批特殊的长上下文数据,把多个文档和子任务精心打乱、拼接,让里面埋的任务只有跨越整个一百万 token、把散落各处的信息都串起来才能解出来。这等于是逼着模型在真实的长距离上练本事,防止它偷懒退化成只看眼前。
训练的时候,上下文窗口是分四个阶段慢慢撑大的,预训练期从 8K 长到 64K,冷却期再从 256K 拉到 1M。把最烧钱的超长序列计算集中在训练后期一小段,既省了成本,又让模型循序渐进地适应越来越长的依赖关系。
九个专家,蒸成一个。
架构和预训练之后,是后训练,这一步决定模型好不好用。
K3 的后训练分三步走。先用监督微调打个高质量的底子,再用强化学习练出各个领域的专家,最后把这些专家合并成一个统一的模型。
强化学习(RL):让模型通过大量试错来学习,做对了给奖励,做错了给惩罚,逼它自己摸索出更优的策略。就像训练一只牧羊犬,你不用逐个动作教它,你只在它把羊赶到位时奖励它,它自己就会琢磨出该怎么跑位。当前最强模型的推理和智能体能力,很大程度上都是 RL 练出来的。
K3 的 RL 铺得很广,横跨三大领域,通用任务、通用智能体、编程智能体。每个领域再配三档思考强度,低、高、最高。三乘三,一共练出 9 个专家模型。
问题来了,用户总不能面对九个模型自己挑。K3 用一套叫多教师在线策略蒸馏的方法,把这九个专家的本事,统统压进一个统一的模型里。
蒸馏(Distillation):让一个模型(学生)去模仿一个或多个更强模型(老师)的输出,从而把老师的能力学过来。这里是九个各有所长的老师同时带一个学生,学生最后一个人就能顶九个专家。好处是用户拿到的是一个既全能、又不用手动切换的模型。
还有个工程上的细节,K3 从监督微调阶段就开始做量化感知训练,权重用 MXFP4、激活用 MXFP8 这种低精度格式。
量化感知训练(QAT):在训练过程中就让模型习惯低精度的数字格式,而不是训练完再压缩。好比运动员平时就穿着比赛装备训练,正式上场时不会因为装备变化而失常。这让 K3 天生兼容各种硬件的低精度推理,跑起来更省。
把 2.8 万亿训起来,靠的是基建
一个 2.8 万亿参数、要吃一百万 token 的模型,光有好设计还不够,底下得有能扛住的基建。报告里这部分是硬功夫,挑三个最关键的说。
第一个是训练时的负载均衡。这么多专家分布在成百上千张卡上,只要有一部分专家忙一部分闲,整个集群的吞吐就会被最慢的那批拖垮。
K3 搞了一套叫 MoonEP 的方案,让专家执行完美均衡,用静态的计算形状和零拷贝通信,把这种忙闲不均消灭掉。
第二个是推理时的缓存。KDA 那个固定大小的笔记本状态,和 MLA 那个随长度增长的常规缓存,两者性质完全不同,分开管会把逻辑搞得又乱又重。
K3 设计了一套 KDA 感知的前缀缓存,把两种缓存统一到同一套分页管理里,让百万 token 的前缀既能便宜地存着,又能跨请求复用。这直接关系到它能不能以有竞争力的价格对外服务。
第三个是智能体训练用的沙箱。K3 的很多任务动辄要调用成百上千次工具、跑上几百万 token,中途一旦崩了不能从头再来。团队用了可恢复的微型虚拟机沙箱,配上部分回合保留、外部 KV 缓存保持等一系列手段,把长命的模型状态和环境状态都稳稳兜住。
这些东西平时没人聊,但它们才是一个 3T 模型能真跑起来的地基。
跑分,能打,且便宜
K3 的整体定位很清楚,落后于 Claude Fable 5 和 GPT-5.6 Sol 这两座山,但对其余所有开源和闭源模型都保持领先。这是它自己承认的,也是评测印证的。但在几个具体项目上,它是全场第一。
基准Kimi K3说明SWE-Marathon42.0超长软件工程任务,全场最高BrowseComp91.2网络浏览搜索,全场最高OmniDocBench91.1文档解析,超过所有闭源模型WebDev Arena1678 Elo首个登顶该榜的开源模型
第三方的独立评测也给了位置。在 Artificial Analysis 的智能指数 v4.1 上,K3 拿到 57.1 分,在 580 个模型里排第四。
在众包的人类偏好竞技场 WebDev Arena 上,K3 以 1678 的 Elo 拿下第一,成为第一个登顶这个榜单的开源模型。
在 Kimi Code Bench 2.0 上,它只比 Claude Fable 5 低 4 分,成本却只有对方的 38%。在 BrowseComp 上,它拿了全场最高分,每个任务只花 2.03 美元,是 GPT-5.6 Sol 的一半,比 Claude 系列在最高强度下便宜一个数量级。
报告的原话是,K3 稳稳坐在成本效率的前沿上,用 Fable 5 零头的价格,交付接近顶尖的分数。
▲ 图 13 · 四个任务上的分数(纵轴)对每任务成本(横轴)。
红色五角星是 K3,它几乎总是待在图的左上角,也就是又贵又强的对手拿不到的那个位置,同样的分数它花的钱最少。
对一个开源模型来说,能打是本分,又能打又便宜才是杀招。
它已经开始给自己干活了
技术报告的最后是案例研究,这部分最能说明 K3 到底强在哪,也最超现实。
先说那个开头埋的伏笔。团队测了各家模型优化 GPU 内核的能力,每个模型在相同沙箱里独立干最多 24 小时。
K3 把一个 AttnRes 内核的延迟从 283.6 毫秒压到 114.4 毫秒,另外两个内核分别提速 55% 和 74%,成绩追平带回退的 Fable 5,大幅甩开其他对手。而在 K3 开发后期,一个早期版本的 K3 就已经在承担团队大部分的内核优化工作了。
▲ 图 14 · AttnRes 内核优化过程。横轴是投入的工作小时,纵轴是相对基线的提速百分比。红色的 K3 冲得最快最高,最终 +59.7%,几乎贴着带回退的 Fable 5,把两个 GPT 甩在身后。
模型帮着优化生产它自己的流水线。这个自举的循环,是这份报告里最让人后背发凉的信号。
K3 从零写了一个类 Triton 的编译器 MiniTriton,从 DSL 前端、中间表示优化,一直到 PTX 代码生成和运行时,是一条完整的链路,某些工作负载上性能还超过了 Triton 本身。
它甚至给一个基于自身架构的 nano 模型设计了一块推理芯片,在一次 48 小时的完全自主运行里,用开源工具完成构建、优化和验证,4 平方毫米内跑到 100 MHz、每秒 8700 多 token 的解码吞吐。
科研上,为了复现计算天体物理里的一组普适关系,K3 审阅了 20 多篇论文、评估了 300 多个状态方程、写了 3000 多行 Python,还顺手揪出了已发表公式里的错误,全程约 2 小时,而一个有经验的研究员干这个要一到两周。
它还做了一份关于 ASIC 行业 42 年历史的交互式研究网站,经历 120 多轮自我改进,翻阅了超过 1.1 万页材料。
最后一个案例带点黑色幽默。K3 用它的原生多模态能力,剪了一支自己的发布预告片,56 段素材,逐帧卡点。它还做了一支 3Blue1Brown 风格的动画讲解视频,讲的正是它自己的架构。
结语,前沿这个词,第一次对所有人开放
一份技术报告,为什么敢在第二段就承认打不过对手?读完 47 页你会明白,因为它手里的牌,根本不需要靠话术来撑。全球第一个开源 3T 模型,一块自己设计的芯片,一个从零手搓的编译器,还有五分之一的旗舰价格。承认与 Fable 5 的差距,反而把开源阵营最强这件事衬得无可辩驳。
报告结论里有一句话,我很喜欢。它说,尽管与最强闭源模型的差距仍在,K3 建立起了一个新的开源前沿,一个人人触手可及的前沿。
过去很长一段时间,前沿是个封闭的词,被锁在几家巨头的服务器里。而这份报告在说的是,从现在起,那道前沿的门,向所有想研究、想部署、想创新的人打开了。
更值得琢磨的是那个反复出现的自举信号。K3 优化了生产 K3 的内核,K3 给基于自己架构的模型设计了芯片,K3 讲解了自己的架构。一个模型开始参与构建它自己的下一版,这件事正在从科幻概念,变成技术报告里一行行朴素的记录。
模型学会造模型的那一天,也许不会有惊天动地的宣告。它可能就是这样,安安静静地写在一份坦诚的技术报告里,夹在一句「早期版本已经在帮我们优化内核了」的轻描淡写之间。
原文来源:Kimi K3 Technical Report · Moonshot AI
一个模型,朝三个方向同时长大
传统上,把一个语言模型做大,大家想到的就是堆层数、堆参数。K3 的设计思路更立体,它让信息沿着三个方向同时流动,序列长度、网络深度、模型宽度。你可以把它想象成一栋楼,长度是每层楼有多宽敞,深度是楼有多少层,宽度是每层能同时容纳多少个专业工种。
注意力机制(Attention):让模型处理每个词时,能同时看到句子里其他所有词,并判断谁更重要。就像你在嘈杂的聚会里找朋友,眼睛会自动扫向熟悉的轮廓,而不是逐张脸排查。它是所有大模型的地基。
序列方向上,K3 用了一套混合注意力,把三层 Kimi Delta Attention 配一层 Gated MLA,三比一的比例贯穿整个网络。深度方向上,一套叫 Attention Residuals 的机制,让每一层都能回头看之前所有层的信息。宽度方向上,每层注意力后面接一个 Stable LatentMoE,从 896 个专家里每次只挑 16 个干活。
右侧是主干,每个 block 由三层 KDA 加一层 Gated MLA 组成,暗红色的连线就是 AttnRes,让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家,左下是 KDA 模块,底部是原生视觉通路 MoonViT-V2。
这三招合起来,加上更精细的数据和训练配方,换来一个硬指标,相比上一代 Kimi K2,整体的扩展效率提升了约 2.5 倍。
扩展效率(Scaling Efficiency):花同样的算力,能换出多少智能。2.5 倍的意思是,K3 用一份算力干的活,K2 得用两份半才能追上。在动辄烧掉上亿美元训练成本的年代,这个倍数直接决定了一家公司烧钱的性价比。
▲ 图 7 · 横轴是算力(FLOPs),纵轴是验证损失,越低越好。红色是 K3,蓝色是 K2。同样的损失水平,红线只需要蓝线约五分之二的算力就能达到,那个横向箭头标的就是 2.5 倍的效率差。
序列方向,让长文本变便宜的 KDA。
标准注意力有个要命的毛病,每多读一个词,它都要拿这个词跟前面所有词两两比对一遍,计算量随着长度平方级暴涨。读一篇短文没事,读一百万字的文档,光注意力这一项就能把显存和时间烧穿。
K3 的解法是 Kimi Delta Attention,简称 KDA。
线性注意力(Linear Attention):把注意力从平方级成本压到线性级的一类技术。传统注意力像你每记一件新事,都要把脑子里所有旧事翻出来对一遍。线性注意力像随身带一个不断更新的笔记本,来一件新事就往本子上改几笔,不用每次重翻全本。KDA 就是这类笔记本里比较聪明的一种,它给笔记本的每一栏都配了一个可调的遗忘开关,哪些旧信息该淡忘、哪些该留着,模型自己学。
但纯线性注意力有个短板,它太依赖那个压缩过的笔记本,有时候会漏掉需要精确翻查原文的细节。所以 K3 每隔三层 KDA,就插一层 Gated MLA 做全局注意力兜底,把最要紧的全局关系重新精确算一遍。而且网络最后一层一定是 Gated MLA,保证模型收尾时看的是全局。
省钱的活交给 KDA,较真的活交给 MLA,三比一搭配。这套组合还带来一个意外的好处,K3 处理位置信息不靠传统的位置编码,而是靠 KDA 那套遗忘和衰减机制隐式地记住谁先谁后。好处是,它能直接外推到一百万 token,不需要任何位置编码上的魔改。
深度方向,让每一层都能回头看。
常规的深层网络有个隐忧,信息是一层一层顺着往上传的,传到几十层之后,最底下那层学到的东西,可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后跟原话往往对不上。
K3 用 Attention Residuals(注意力残差)解决这件事。
注意力残差(AttnRes):让网络里每一个模块,都能越过中间所有层,直接回头去调取最初的输入、以及之前任意一个模块的输出。打个比方,普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。
对一个有 93 层的深层模型来说,这个能力很关键。它让深层的信息访问不再是单线的接力,而是变成一张可以按需检索的网。底层学到的原始信号,到了顶层依然能被精准调用。
宽度方向,896 个专家里怎么只用 16 个还不翻车
混合专家模型(MoE):把一个巨大的模型拆成很多个专家子网络,每次只唤醒其中几个来处理当前的词。好比一家 896 人的会诊医院,每个病人只安排 16 个最对口的专家出诊,其他人待命。医院名义规模巨大,但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因,参数量做得极大,但每个 token 实际激活的计算量被控制得很小。
K3 的这套叫 Stable LatentMoE,把路由专家扩到 896 个,每个 token 只激活 16 个。这个稀疏度相当极端,激活的专家还不到总数的百分之二。
稀疏度一旦拉到这么高,训练就容易出乱子。最典型的问题是专家分配不均,有些专家被抢着用、累到冒烟,有些常年闲置、白占参数。K3 用了一个叫 Quantile Balancing 的办法,直接从路由分数的分位数来推导专家分配,砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和一个新的激活函数 SiTU-GLU,才把这么稀疏的模型在训练时摁稳。
一句话总结这三节,K3 不是简单地把模型堆大,它是想清楚了信息在一个巨型模型里会在哪几个方向卡住,然后一个方向一个方向地把管道拓宽。
从 K2 到 K3,到底大了多少?
这些改动落到具体数字上,是一次全面的放大。报告里给了一张 K2 和 K3 的对照表,很能说明问题。
激活参数(Activated Parameters):模型每处理一个 token,真正参与计算的那部分参数。K3 总参数 2.78 万亿,但每次只激活 1042 亿。这个区分很重要,总参数决定模型见识的上限,激活参数决定它跑起来的实际开销。K3 相当于一个见多识广的巨人,但每次只调动身体的一小部分肌肉,所以既聪明又跑得动。
还有一点容易被忽略,K3 是原生多模态。它不是先训好一个语言模型,再把视觉模块焊上去,而是从训练的第一天起,文字和图像的 token 就交织在同一个预测目标里一起学。
视觉这条路用的是一个叫 MoonViT-V2 的 4 亿参数视觉编码器,能处理最高 3584×3584 像素的图像,还能在百万 token 的上下文里放得下。
一百万 token 是怎么喂进去的
上下文从 K2 的 12.8 万直接干到 K3 的一百万,这不是把数字改大就行。
真正长又连贯的文档和视频其实很稀缺,网上大量的长内容是重复、截断、机器生成的垃圾日志。K3 先用一套专门的清洗流水线把这些噪声滤掉,再刻意把优质长文档上采样,免得训练时被海量短文本淹没。
光有长文档还不够,长度本身不等于长程能力。所以团队还合成了一批特殊的长上下文数据,把多个文档和子任务精心打乱、拼接,让里面埋的任务只有跨越整个一百万 token、把散落各处的信息都串起来才能解出来。这等于是逼着模型在真实的长距离上练本事,防止它偷懒退化成只看眼前。
训练的时候,上下文窗口是分四个阶段慢慢撑大的,预训练期从 8K 长到 64K,冷却期再从 256K 拉到 1M。把最烧钱的超长序列计算集中在训练后期一小段,既省了成本,又让模型循序渐进地适应越来越长的依赖关系。
九个专家,蒸成一个。
架构和预训练之后,是后训练,这一步决定模型好不好用。
K3 的后训练分三步走。先用监督微调打个高质量的底子,再用强化学习练出各个领域的专家,最后把这些专家合并成一个统一的模型。
强化学习(RL):让模型通过大量试错来学习,做对了给奖励,做错了给惩罚,逼它自己摸索出更优的策略。就像训练一只牧羊犬,你不用逐个动作教它,你只在它把羊赶到位时奖励它,它自己就会琢磨出该怎么跑位。当前最强模型的推理和智能体能力,很大程度上都是 RL 练出来的。
K3 的 RL 铺得很广,横跨三大领域,通用任务、通用智能体、编程智能体。每个领域再配三档思考强度,低、高、最高。三乘三,一共练出 9 个专家模型。
问题来了,用户总不能面对九个模型自己挑。K3 用一套叫多教师在线策略蒸馏的方法,把这九个专家的本事,统统压进一个统一的模型里。
蒸馏(Distillation):让一个模型(学生)去模仿一个或多个更强模型(老师)的输出,从而把老师的能力学过来。这里是九个各有所长的老师同时带一个学生,学生最后一个人就能顶九个专家。好处是用户拿到的是一个既全能、又不用手动切换的模型。
还有个工程上的细节,K3 从监督微调阶段就开始做量化感知训练,权重用 MXFP4、激活用 MXFP8 这种低精度格式。
量化感知训练(QAT):在训练过程中就让模型习惯低精度的数字格式,而不是训练完再压缩。好比运动员平时就穿着比赛装备训练,正式上场时不会因为装备变化而失常。这让 K3 天生兼容各种硬件的低精度推理,跑起来更省。
把 2.8 万亿训起来,靠的是基建
一个 2.8 万亿参数、要吃一百万 token 的模型,光有好设计还不够,底下得有能扛住的基建。报告里这部分是硬功夫,挑三个最关键的说。
第一个是训练时的负载均衡。这么多专家分布在成百上千张卡上,只要有一部分专家忙一部分闲,整个集群的吞吐就会被最慢的那批拖垮。
K3 搞了一套叫 MoonEP 的方案,让专家执行完美均衡,用静态的计算形状和零拷贝通信,把这种忙闲不均消灭掉。
第二个是推理时的缓存。KDA 那个固定大小的笔记本状态,和 MLA 那个随长度增长的常规缓存,两者性质完全不同,分开管会把逻辑搞得又乱又重。
K3 设计了一套 KDA 感知的前缀缓存,把两种缓存统一到同一套分页管理里,让百万 token 的前缀既能便宜地存着,又能跨请求复用。这直接关系到它能不能以有竞争力的价格对外服务。
第三个是智能体训练用的沙箱。K3 的很多任务动辄要调用成百上千次工具、跑上几百万 token,中途一旦崩了不能从头再来。团队用了可恢复的微型虚拟机沙箱,配上部分回合保留、外部 KV 缓存保持等一系列手段,把长命的模型状态和环境状态都稳稳兜住。
这些东西平时没人聊,但它们才是一个 3T 模型能真跑起来的地基。
跑分,能打,且便宜
K3 的整体定位很清楚,落后于 Claude Fable 5 和 GPT-5.6 Sol 这两座山,但对其余所有开源和闭源模型都保持领先。这是它自己承认的,也是评测印证的。但在几个具体项目上,它是全场第一。
基准Kimi K3说明SWE-Marathon42.0超长软件工程任务,全场最高BrowseComp91.2网络浏览搜索,全场最高OmniDocBench91.1文档解析,超过所有闭源模型WebDev Arena1678 Elo首个登顶该榜的开源模型
第三方的独立评测也给了位置。在 Artificial Analysis 的智能指数 v4.1 上,K3 拿到 57.1 分,在 580 个模型里排第四。
在众包的人类偏好竞技场 WebDev Arena 上,K3 以 1678 的 Elo 拿下第一,成为第一个登顶这个榜单的开源模型。
在 Kimi Code Bench 2.0 上,它只比 Claude Fable 5 低 4 分,成本却只有对方的 38%。在 BrowseComp 上,它拿了全场最高分,每个任务只花 2.03 美元,是 GPT-5.6 Sol 的一半,比 Claude 系列在最高强度下便宜一个数量级。
报告的原话是,K3 稳稳坐在成本效率的前沿上,用 Fable 5 零头的价格,交付接近顶尖的分数。
▲ 图 13 · 四个任务上的分数(纵轴)对每任务成本(横轴)。
红色五角星是 K3,它几乎总是待在图的左上角,也就是又贵又强的对手拿不到的那个位置,同样的分数它花的钱最少。
对一个开源模型来说,能打是本分,又能打又便宜才是杀招。
它已经开始给自己干活了
技术报告的最后是案例研究,这部分最能说明 K3 到底强在哪,也最超现实。
先说那个开头埋的伏笔。团队测了各家模型优化 GPU 内核的能力,每个模型在相同沙箱里独立干最多 24 小时。
K3 把一个 AttnRes 内核的延迟从 283.6 毫秒压到 114.4 毫秒,另外两个内核分别提速 55% 和 74%,成绩追平带回退的 Fable 5,大幅甩开其他对手。而在 K3 开发后期,一个早期版本的 K3 就已经在承担团队大部分的内核优化工作了。
▲ 图 14 · AttnRes 内核优化过程。横轴是投入的工作小时,纵轴是相对基线的提速百分比。红色的 K3 冲得最快最高,最终 +59.7%,几乎贴着带回退的 Fable 5,把两个 GPT 甩在身后。
模型帮着优化生产它自己的流水线。这个自举的循环,是这份报告里最让人后背发凉的信号。
K3 从零写了一个类 Triton 的编译器 MiniTriton,从 DSL 前端、中间表示优化,一直到 PTX 代码生成和运行时,是一条完整的链路,某些工作负载上性能还超过了 Triton 本身。
它甚至给一个基于自身架构的 nano 模型设计了一块推理芯片,在一次 48 小时的完全自主运行里,用开源工具完成构建、优化和验证,4 平方毫米内跑到 100 MHz、每秒 8700 多 token 的解码吞吐。
科研上,为了复现计算天体物理里的一组普适关系,K3 审阅了 20 多篇论文、评估了 300 多个状态方程、写了 3000 多行 Python,还顺手揪出了已发表公式里的错误,全程约 2 小时,而一个有经验的研究员干这个要一到两周。
它还做了一份关于 ASIC 行业 42 年历史的交互式研究网站,经历 120 多轮自我改进,翻阅了超过 1.1 万页材料。
最后一个案例带点黑色幽默。K3 用它的原生多模态能力,剪了一支自己的发布预告片,56 段素材,逐帧卡点。它还做了一支 3Blue1Brown 风格的动画讲解视频,讲的正是它自己的架构。
结语,前沿这个词,第一次对所有人开放
一份技术报告,为什么敢在第二段就承认打不过对手?读完 47 页你会明白,因为它手里的牌,根本不需要靠话术来撑。全球第一个开源 3T 模型,一块自己设计的芯片,一个从零手搓的编译器,还有五分之一的旗舰价格。承认与 Fable 5 的差距,反而把开源阵营最强这件事衬得无可辩驳。
报告结论里有一句话,我很喜欢。它说,尽管与最强闭源模型的差距仍在,K3 建立起了一个新的开源前沿,一个人人触手可及的前沿。
过去很长一段时间,前沿是个封闭的词,被锁在几家巨头的服务器里。而这份报告在说的是,从现在起,那道前沿的门,向所有想研究、想部署、想创新的人打开了。
更值得琢磨的是那个反复出现的自举信号。K3 优化了生产 K3 的内核,K3 给基于自己架构的模型设计了芯片,K3 讲解了自己的架构。一个模型开始参与构建它自己的下一版,这件事正在从科幻概念,变成技术报告里一行行朴素的记录。
模型学会造模型的那一天,也许不会有惊天动地的宣告。它可能就是这样,安安静静地写在一份坦诚的技术报告里,夹在一句「早期版本已经在帮我们优化内核了」的轻描淡写之间。
原文来源:Kimi K3 Technical Report · Moonshot AI