小模型 Agent 能力测试的天梯在这里~ (希望图不要被压得太狠....)
目前来看最值得使用是我测试的 Qwen3.8-27B-UD-Q4_K_XL 版本, Agent 用使用 reasoning_effort = low, 然后写代码开到 medium / high.
另外文中是统一使用单卡 H100 NVL+llama.cpp 最新版本测试的. 如果是Mac用户还是建议优先使用MLX, 实测 MLX 开 MTP 会比 llama.cpp 放在 Mac 上开MTP要快一些.
最后老铁们还想看什么模型的评测欢迎留言~ 我赶紧肝哈哈
#qwen38