Kimi K3开源引爆AI开源战争,黄仁勋联合77家公司上书反对制裁 · AI HOT
数字生命卡兹克@Khazix091860
2026-07-28 12:59· 35分钟前
跳到正文AI 摘要
7月17日,月之暗面发布全球首个开源的3T级模型Kimi K3,总参数2.8万亿、激活参数1040亿,支持100万Token上下文,并承诺于7月27日开源权重、47页技术报告及关键Infra(MoonEP、FlashKDA、AgentENV)。
数字生命卡兹克@Khazix0918 · X2026-07-28 12:59·35分钟前
在 X 看原推· x.comAI 摘要7月17日,月之暗面发布全球首个开源的3T级模型Kimi K3,总参数2.8万亿、激活参数1040亿,支持100万Token上下文,并承诺于7月27日开源权重、47页技术报告及关键Infra(MoonEP、FlashKDA、AgentENV)。
然后呢,在最下面,一个很长的Logo墙被贴了出来,整个科技行业开始排队在公开信上签名。
英伟达、微软、Meta、IBM、戴尔、Palantir、Mistral、Hugging Face等等等等。
OpenAI来了,Google来了,SpaceX来了,AMD、Cisco、Cloudflare、GitHub、Linux Foundation、Mozilla、Vercel、Y Combinator、OpenClaw等等,也全都来了。
好久好久好久没见过这么集结,一起起义,同仇敌忾的了。
但是如果细心的朋友就会发现,上面那个logo墙,几乎集结了美国绝大多数的前沿科技公司,甚至英伟达和AMD都世纪同框了,但是你会发现,莫名其妙的怎么缺了一个熟悉的名字。
我觉得这张世界名画可以改名叫《Anthropic在哪里?》。
而就在Anthropic装死,美国科技巨头们联手推特上书起义之时。
本次事件的导火索,在昨晚,也就是7月27日晚上23点13分,正式官宣了Kimi K3开源。
Kimi K3模型权重,一个2.8万亿参数的MoE模型,一共有896个专家,每个Token激活其中16个。
这里面公开了KDA和Attention Residuals的架构细节,解释了他们如何用3比1的比例混合KDA与Gated MLA,如何让信息跨越几十层继续流动。
896个专家只激活16个,稀疏程度高得离谱,Kimi又用SiTU GLU、Quantile Balancing这一整套方法,把这种极端稀疏的训练维持在稳定状态。
还有MoonViT V2、百万Token上下文的强化学习基础设施、大规模任务合成、后训练方法,接近20个内部评测集的完整结果也放了出来。
MoonEP,一套专门为超大规模MoE打造的专家并行通信库。
MoE训练时,经常会出现某些专家忙得要死,某些专家闲得抠脚,最后所有GPU都得等最忙的那一张卡。
MoonEP会根据当前路由结果,动态复制一小部分热门专家,让每张卡收到完全一样数量的Token,同时维持静态内存形状,避免训练越跑越碎,最后直接OOM。
这已经属于超大模型训练里非常底层、非常值钱的东西了。
FlashKDA,Kimi Delta Attention的高性能算子。
它用CUTLASS实现,在英伟达H20上,相比flash linear attention基线,prefill速度提升了1.85倍到2.31倍,还可以直接接进现有的flash linear attention后端。
这是Kimi和KVCache.ai一起做的分布式Agent沙箱系统,也是K3做大规模Agent强化学习时真正跑环境的那层底座。
它可以在一堆机器上同时启动海量Firecracker微虚拟机,环境恢复低于50毫秒,暂停低于100毫秒,还原生支持快照、恢复和fork。
一个Agent跑到某个关键节点以后,可以直接分叉成几十条互不干扰的轨迹,继续并行探索。
虽然我对底层技术不是很了解,只是纸上谈兵的一些浅薄知识,但是从这几个技术来说,我觉得已经能感受到真香了。
AgentENV解决Agent强化学习需要的海量真实环境。
如今,我愿将Kimi和DeepSeek并称为开源二圣。
普通研究者、开发者和公司,可以免费使用、复制、修改、部署、微调、分发,也可以做衍生产品和商业化。
如果你做模型服务生意,公司及关联方连续12个月总收入超过2000万美元,需要另行和月之暗面签协议。
如果使用K3的商业产品月活超过1亿,或者单月收入超过2000万美元,产品界面需要显著展示Kimi K3。
已经有人说,如果Kimi K3能给他带来单月2000万美元的收入,别说显著展示Kimi K3的品牌标识了。
他可以把Kimi的logo纹在屁股上,甚至可以纹两个。
今天这晚,随着Kimi K3的开源,我感觉把整个事件,推向了最终的高潮,舆论基本一边倒。
这一刻,美国的态度,和Kimi K3开源,有了一种神奇的化学反应。
老黄他们拥抱开源,当然除了理想之外,还有很多金钱的气息。
2002年,Joel Spolsky写过一个很经典的商业规律,叫Commoditize Your Complements,把你的互补品变成商品。
一个东西的互补品越便宜,人们对这个东西的需求就越大。
开源模型越多,全球就有越多公司愿意自己部署、自己微调、自己训练,最后需要的GPU也越多。
AMD、戴尔、云计算公司、推理服务商,逻辑差不多。
GitHub、Vercel、Replit、LangChain、OpenClaw这些开发工具和应用平台,也天然希望底层模型越来越多、越来越便宜、越来越容易替换。
因为模型成本每降一块钱,应用层就多出一块钱的空间。
老黄坚定的相信开源,以及老黄是开源模型的最大受益者之一,这两件事不冲突的。
这辈子,我可能都训练不起K3这样的模型,我没有几万张卡,我什么都不懂,技术报告里的公式,我都只能在AI的加持下勉勉强强看懂一点点。
但是不妨碍我,今天,踩在无数前人开源的工作、框架还有模型上,来创作我自己的作品。
普通人能参与每一次技术革命,靠的其实就是前面那些前辈,愿意把终点留下来,给后来的人,当起点。
一个团队花掉巨大算力、无数大佬熬了很久才得到的东西,一旦公开,第二天就会成为全世界无数普通人的公共起点。
最后,向所有为人类世界、开源世界、AI世界的大佬们。
2.8万亿总参数,1040亿激活参数,原生视觉能力,100万Token上下文。
最关键的是,Kimi当时就承诺,模型权重会在7月27日(也就是昨晚)正式开源。
一个中国团队,在算力远没有那么宽裕的情况下,做出了一个能力逼近全球最强闭源模型的东西,还要把权重交给全世界。
7月22日,美国白宫科技政策办公室负责人Michael Kratsios公开指控月之暗面,声称Kimi K3的开发使用了对Claude Fable 5的大规模蒸馏。
然后呢,美国财政部长好死不死,火上浇油,又提到了贸易黑名单和制裁。
这个事越闹越大,眼瞅着一场原本关于模型能力和开源路线的竞争,迅速被拖进了知识产权、国家安全、出口管制和中美科技竞争里。
两天以后,他发出了人生第一条X,用一封公开信告诉华盛顿,开放模型关乎美国的创新、竞争、安全和技术主权,你不能封禁,不能制裁,我们得鼓励开源。
然后呢,在最下面,一个很长的Logo墙被贴了出来,整个科技行业开始排队在公开信上签名。
英伟达、微软、Meta、IBM、戴尔、Palantir、Mistral、Hugging Face等等等等。
OpenAI来了,Google来了,SpaceX来了,AMD、Cisco、Cloudflare、GitHub、Linux Foundation、Mozilla、Vercel、Y Combinator、OpenClaw等等,也全都来了。
好久好久好久没见过这么集结,一起起义,同仇敌忾的了。
但是如果细心的朋友就会发现,上面那个logo墙,几乎集结了美国绝大多数的前沿科技公司,甚至英伟达和AMD都世纪同框了,但是你会发现,莫名其妙的怎么缺了一个熟悉的名字。
我觉得这张世界名画可以改名叫《Anthropic在哪里?》。
而就在Anthropic装死,美国科技巨头们联手推特上书起义之时。
本次事件的导火索,在昨晚,也就是7月27日晚上23点13分,正式官宣了Kimi K3开源。
Kimi K3模型权重,一个2.8万亿参数的MoE模型,一共有896个专家,每个Token激活其中16个。
这里面公开了KDA和Attention Residuals的架构细节,解释了他们如何用3比1的比例混合KDA与Gated MLA,如何让信息跨越几十层继续流动。
896个专家只激活16个,稀疏程度高得离谱,Kimi又用SiTU GLU、Quantile Balancing这一整套方法,把这种极端稀疏的训练维持在稳定状态。
还有MoonViT V2、百万Token上下文的强化学习基础设施、大规模任务合成、后训练方法,接近20个内部评测集的完整结果也放了出来。
MoonEP,一套专门为超大规模MoE打造的专家并行通信库。
MoE训练时,经常会出现某些专家忙得要死,某些专家闲得抠脚,最后所有GPU都得等最忙的那一张卡。
MoonEP会根据当前路由结果,动态复制一小部分热门专家,让每张卡收到完全一样数量的Token,同时维持静态内存形状,避免训练越跑越碎,最后直接OOM。
这已经属于超大模型训练里非常底层、非常值钱的东西了。
FlashKDA,Kimi Delta Attention的高性能算子。
它用CUTLASS实现,在英伟达H20上,相比flash linear attention基线,prefill速度提升了1.85倍到2.31倍,还可以直接接进现有的flash linear attention后端。
这是Kimi和KVCache.ai一起做的分布式Agent沙箱系统,也是K3做大规模Agent强化学习时真正跑环境的那层底座。
它可以在一堆机器上同时启动海量Firecracker微虚拟机,环境恢复低于50毫秒,暂停低于100毫秒,还原生支持快照、恢复和fork。
一个Agent跑到某个关键节点以后,可以直接分叉成几十条互不干扰的轨迹,继续并行探索。
虽然我对底层技术不是很了解,只是纸上谈兵的一些浅薄知识,但是从这几个技术来说,我觉得已经能感受到真香了。
AgentENV解决Agent强化学习需要的海量真实环境。
如今,我愿将Kimi和DeepSeek并称为开源二圣。
普通研究者、开发者和公司,可以免费使用、复制、修改、部署、微调、分发,也可以做衍生产品和商业化。
如果你做模型服务生意,公司及关联方连续12个月总收入超过2000万美元,需要另行和月之暗面签协议。
如果使用K3的商业产品月活超过1亿,或者单月收入超过2000万美元,产品界面需要显著展示Kimi K3。
已经有人说,如果Kimi K3能给他带来单月2000万美元的收入,别说显著展示Kimi K3的品牌标识了。
他可以把Kimi的logo纹在屁股上,甚至可以纹两个。
今天这晚,随着Kimi K3的开源,我感觉把整个事件,推向了最终的高潮,舆论基本一边倒。
这一刻,美国的态度,和Kimi K3开源,有了一种神奇的化学反应。
老黄他们拥抱开源,当然除了理想之外,还有很多金钱的气息。
2002年,Joel Spolsky写过一个很经典的商业规律,叫Commoditize Your Complements,把你的互补品变成商品。
一个东西的互补品越便宜,人们对这个东西的需求就越大。
开源模型越多,全球就有越多公司愿意自己部署、自己微调、自己训练,最后需要的GPU也越多。
AMD、戴尔、云计算公司、推理服务商,逻辑差不多。
GitHub、Vercel、Replit、LangChain、OpenClaw这些开发工具和应用平台,也天然希望底层模型越来越多、越来越便宜、越来越容易替换。
因为模型成本每降一块钱,应用层就多出一块钱的空间。
老黄坚定的相信开源,以及老黄是开源模型的最大受益者之一,这两件事不冲突的。
这辈子,我可能都训练不起K3这样的模型,我没有几万张卡,我什么都不懂,技术报告里的公式,我都只能在AI的加持下勉勉强强看懂一点点。
但是不妨碍我,今天,踩在无数前人开源的工作、框架还有模型上,来创作我自己的作品。
普通人能参与每一次技术革命,靠的其实就是前面那些前辈,愿意把终点留下来,给后来的人,当起点。
一个团队花掉巨大算力、无数大佬熬了很久才得到的东西,一旦公开,第二天就会成为全世界无数普通人的公共起点。
最后,向所有为人类世界、开源世界、AI世界的大佬们。