这次本地模型的天花板可以说是@Alibaba_Qwen 一拳打碎了,标志着本地模型第一次真正摸到了frontier的门槛。
Artificial Analysis最新的Intelligence Index榜单上,阿里Qwen团队开源的Qwen3.8-27B拿了52分,
什么概念呢? DeepSeek V4 Pro 53分, GLM 5.2 53分, GPT-5.6 Luna 52分,
一个27B的dense模型,和1.6T总参数的DeepSeek V4 Pro、闭源旗舰GPT-5.6 Luna站在了同一水平线上,
Cline官方原话,我们完全没预料到本地模型进步会这么快,
这是第一次有能在消费级硬件上跑的本地模型,真正摸到frontier的门槛,
Q4量化只要17GB显存,一张4090,24GB显存,跑得非常舒服,
Apache 2.0协议,原生多模态,262k上下文可扩到1M,混合注意力架构,
前代Qwen3.6-27B大概只有38分,一代跳了十几个点,
但我觉得最的不是这个分数, 是它怎么做到的,
这个模型在评测中生成了1.6亿tokens,而中位数只有4300万,极其啰嗦,
它在用更长的思维链、更多的搜索,来弥补参数量的不足,
小模型通过想得更用力来追平大模型,而本地推理的token成本接近于零,只耗电和时间,
这把test-time compute从巨头的专利,变成了普通人也能用的杠杆,
你在云端跑长思维链要烧钱,在本地跑,电费可以忽略不计,
27B的参数密度能做到这个水平,靠的是高质量的Agent轨迹后训练加架构创新,规模不再是唯一答案,智力密度比参数规模重要得多,
当然也得清醒,它的知识类评测还是偏弱,容易幻觉,更适合Coding和Agent场景,不是纯知识问答,长CoT也意味着实际延迟和功耗不低,需要主动调reasoning effort,
但这不影响这件事的里程碑意义,
以前本地能跑和真正有用之间有一道巨大的鸿沟,现在这道沟第一次被填上了,
对开发者和小团队来说,这意味着真正私有的、离线的、无限次调用的前沿级编码Agent成为可能,
云端闭源模型的纯智力护城河,正在加速瓦解,
24GB显存,就是新的能跑严肃Agent的门槛,
本地AI不再是玩具了,它第一次有资格站到真正的复杂工作流面前。