Qwen3.8-27B 开源模型首次摸到前沿门槛

AYi · @AYi_AInotes · X·2026-08-18 14:34·7天前
AI 导读

阿里 Qwen 开源 Qwen3.8-27B,在 Artificial Analysis Intelligence Index 拿下 52 分,与 DeepSeek V4 Pro(53 分)、GPT-5.6 Luna(52 分)等闭源旗舰同级,成为首个达到前沿能力的本地模型。

AYi@AYi_AInotes
48AI 编辑部评分,满分 100

Qwen3.8-27B 开源模型首次摸到前沿门槛

2026-08-18 14:34· 7天前
AI 导读

阿里 Qwen 开源 Qwen3.8-27B,在 Artificial Analysis Intelligence Index 拿下 52 分,与 DeepSeek V4 Pro(53 分)、GPT-5.6 Luna(52 分)等闭源旗舰同级,成为首个达到前沿能力的本地模型。

这次本地模型的天花板可以说是@Alibaba_Qwen 一拳打碎了,标志着本地模型第一次真正摸到了frontier的门槛。

Artificial Analysis最新的Intelligence Index榜单上,阿里Qwen团队开源的Qwen3.8-27B拿了52分,

什么概念呢? DeepSeek V4 Pro 53分, GLM 5.2 53分, GPT-5.6 Luna 52分,

一个27B的dense模型,和1.6T总参数的DeepSeek V4 Pro、闭源旗舰GPT-5.6 Luna站在了同一水平线上,

Cline官方原话,我们完全没预料到本地模型进步会这么快,

这是第一次有能在消费级硬件上跑的本地模型,真正摸到frontier的门槛,

Q4量化只要17GB显存,一张4090,24GB显存,跑得非常舒服,

Apache 2.0协议,原生多模态,262k上下文可扩到1M,混合注意力架构,

前代Qwen3.6-27B大概只有38分,一代跳了十几个点,

但我觉得最的不是这个分数, 是它怎么做到的,

这个模型在评测中生成了1.6亿tokens,而中位数只有4300万,极其啰嗦,

它在用更长的思维链、更多的搜索,来弥补参数量的不足,

小模型通过想得更用力来追平大模型,而本地推理的token成本接近于零,只耗电和时间,

这把test-time compute从巨头的专利,变成了普通人也能用的杠杆,

你在云端跑长思维链要烧钱,在本地跑,电费可以忽略不计,

27B的参数密度能做到这个水平,靠的是高质量的Agent轨迹后训练加架构创新,规模不再是唯一答案,智力密度比参数规模重要得多,

当然也得清醒,它的知识类评测还是偏弱,容易幻觉,更适合Coding和Agent场景,不是纯知识问答,长CoT也意味着实际延迟和功耗不低,需要主动调reasoning effort,

但这不影响这件事的里程碑意义,

以前本地能跑和真正有用之间有一道巨大的鸿沟,现在这道沟第一次被填上了,

对开发者和小团队来说,这意味着真正私有的、离线的、无限次调用的前沿级编码Agent成为可能,

云端闭源模型的纯智力护城河,正在加速瓦解,

24GB显存,就是新的能跑严肃Agent的门槛,

本地AI不再是玩具了,它第一次有资格站到真正的复杂工作流面前。

ClineArtificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the first time a local model has scored frontie...