Qwen3.8-27B有点牛逼, 把接近Opus的能力, 塞进一张消费级显卡,这是掀桌子了?!
一张24G的卡就能本地跑Claude Opus 4.6了,完全私有🤯!
相当于把Opus级别的编码能力塞进一张大家都用得起的RTX 5090卡上, 200 tok/s,编码能力直接超过Opus 4.6,
咱们先看数字, SWE-bench Pro 61.7,Claude Opus 4.6 Max 53.4。 OSWorld 84.3,Opus 72.7。 编码和Agent能力,这个27B的开源模型打赢了曾经的闭源巅峰模型,
纯推理还有差距,GPQA和HLE落后,但编码、工具调用、操作电脑,这是大多数人每天用AI干的事。
200 tok/s什么概念? SGLang加NVFP4加投机解码,单卡5090实测206 tok/s。
比你读字快,比大多数API响应快,而且跑在你自己机器上。
没网络延迟,没token计费,数据不出门。
门槛极低, Q4量化权重17到18GB,一张24GB的卡就够。
二手3090一千多美元,Q4跑40到70 tok/s,写代码完全够用。
4090更快,5090 32GB是消费级天花板,Q6/Q8随便上,长上下文不慌。
M4 Pro 48GB也能跑,安静省电,就是慢点。
跑法很简单, LM Studio或Ollama,等GGUF量化包出来点一下就行。 追求速度上SGLang,Day-0就支持了。 Unsloth已经发了量化版,Hugging Face和ModelScope直接下。