感觉全网都在吹 Kimi K3 新王登基,我研究了一上午发现吹的方向全错了, 我来给大家关于Kimi K3最客观全面深度的一个分析总结:
Kimi K3 发布这两天铺天盖地的都在比它和 Fable 5 谁更强,什么牛逼新王之类的, 我就纳闷了,这有啥可比的,你们真相信刷分排行榜代表真实能力吗?上一个例子是千问,每次发布找英推的一堆博主吹,结果实战能力拉胯,连豆包都不如🤣
来我们看看这次Kimi和Fable 5 比出来的结果是:35 项共享评估,Fable 5 赢 22 项,K3 赢 12 项,综合智能指数,K3 第 4,Fable 5 第 1。
结论很清楚--它根本不是全能新王者啊😂
但更重要的东西不在这个比分里,在另一个数字里,
Arena 前端/WebDev 人类盲测投票,K3 第 1。1679 Elo,领先 Fable 5 的 1631,领先 GPT-5.6 Sol 的 1618,7 个领域里赢了 6 个,从 K2.6 的第 18 名跳上来的。
人类盲测是什么意思?意思是开发者坐在屏幕前,看着两个页面,不知道谁生成的,然后选了 K3 的那个更好看、更好用。
这就不是刷榜了,属于真人在真实任务里投出来的。
然后你看定价,15 输出。Fable 5 是 50。
长上下文 agentic coding 是高输出量的任务,15 刚好跨过那条线。
说白了,K3 在干的事,不是"比 Fable 5 更全能"。
是在前端和终端代理这块地上,我打到世界级 在别的地方,我接受落后,
这其实是换了个游戏玩法呀, 以前追赶的定义是"在综合 benchmark 上逼近 SOTA",
K3 直接不玩这个游戏了,它选了三块地--前端 UI、终端代理、浏览代理--然后把火力全压上去,结果就是在这些地上,它要求 Fable 5 来追自己。
这算什么兄弟们,这不就是非对称竞争吗?🤣
在综合战场上接受落后,在自己选定的高价值赛道上要求对方追赶,我觉得这才是 K3 真正值得看的地方。
不要再说中国模型终于追上了,本质上是"追赶的定义被改了"。
还有一个容易被忽略的信号,Arena 前端从 K2.6 的第 18 跳到第 1,这个跃迁比分数本身更有冲击力,
它会让前端开发者、全栈 freelancer、Web agency 主动去试,不是因为 Moonshot 说它强--是因为人类同行投票说它生成的页面更好看。
开发者选型时最信任的信号,就是这个。
当然现在就把Kimi3叫王者其实有点为时过早,甚至是愚蠢的,
因为综合能力上 Fable 5 整体依然更稳,深度推理、视觉 polish、最难的那类知识工作任务,K3 还有差距。
速度一般,token 消耗高,早期版本有边缘 bug。数据隐私条款也需要注意--官方说输入可能用于训练。
但这些问题,不影响它做对了一件事,它找到了一个可以称王的狭窄赛道,然后用人类盲测第一 + 价格剪刀差 + 即将开源这三个东西,同时证明了自己在这个赛道上值得认真对待。
等到7 月 27 日权重开放之后,社区会做三件 Moonshot 控制不了的事:独立评测、奇怪任务的 fine-tune、本地长上下文吞吐实测,
这些结果会迅速区分是营销号吹的好和真做的好,
但那之前,有一件事已经清楚了,Kimi K3 不是来当全能冠军的,它是来证明一件事,
以后的 AI 竞争,不需要在每一个维度上都赢,只需要在自己选的地方赢就够了,
别的地方,落后是可以接受的,这个信号其实比 2.8 万亿参数更值得认真看对吧?