终于搞完了! 给大家带来小模型竞技场, 这次测试了8款模型, 包括:
Qwen3.8-27B Qwen3.6-27B Qwen3.6-35B-A3B Ornith-1.5-35B-A3B Gemma-4-31B Gemma-4-26B-A4B Gemma-4-12B GPT-OSS-20B
每个模型4个量化版本, 还测试了 MTP 开启和关闭, 以及 low, medium, xhigh 三档思考强度, 做了个全面横评.
测试主要集中在前端, python, Agent 能力上, 每个测试运行3次取最佳结果(pass@3).
测试使用H100显卡(注意用H100是为了生成快, 就这还跑了48小时, 显卡不影响生成效果, 只影响生成速度), 总成本148刀.
那么这些模型中究竟谁是开源之神? 请看视频!
#qwen38 #qwen3827b #qwen26 #gemma4 #ornith #阿里千问