# Kimi K3 max vs. GPT-5.6 Sol max 对比：级联策略更优

- 来源：meng shao (@shao__meng)
- 发布时间：2026-07-24 10:24
- AIHOT 分数：44
- AIHOT 链接：https://aihot.virxact.com/items/cmrybiqph00mbroxy9s9fa5sa
- 原文链接：https://x.com/shao__meng/status/2080479086481437178

## AI 摘要

Together Compute 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max，两者各有所长。关键数据上，pass@1 中 GPT 以 72.7% 领先 Kimi 的 68.5%，但 pass@4 中 Kimi 以 89.4% 反超 GPT 的 85.8%。

## 正文

Kimi K3 max vs. GPT-5.6 Sol max

@togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max，结论很客观，并没有谁前面碾压谁，在真实软件工程中各有所长，搭配使用、路由 + 级联是更优的方案。

关键数据：单次稳，多次翻盘
pass@1：GPT 72.7%，Kimi 68.5%
pass@2：GPT 81.0%，Kimi 82.0%（已反超）
pass@4：GPT 85.8%，Kimi 89.4%（优势更大）

成本与速度：便宜 vs 快
· 单价：Kimi ≈ $4.65 / rollout，Sol ≈ $8.37
· 单位预算产出：每花 $100，Kimi 解约 14.7 题，Sol 约 5.3 题
· 时延：Sol 中位约 17 分钟，Kimi 约 66 分钟；Kimi 步数更多，Zain 认为是模型行为，推理侧优化后端到端延迟仍有改善空间

语言与领域专长
语言
· Kimi 更强：Rust（65-60）
· Sol 更强：Python / TS / JS
· Go：平手（79-79）

领域（8 类中 Sol 赢 5、Kimi 赢 3）
· 倾向 Sol：序列化、并发、程序分析
· 倾向 Kimi：运维工具、运行时内部
· 合规/一致性：接近抛硬币（61-59）

为何适合组合：低相关 + 不同失败模式
· 任务级相关约 0.46--成功与失败路径明显不同
· 两模型并集覆盖 108 / 113（95.6%），作者称是该基准上最好的双模型组合
· 失败形态也不同：
· Sol：约 20% 失败会弄坏仓库原有测试（与其他 GPT 系类似）
· Kimi：基线测试破坏较少（约 11%），但约 65% 是"差一点"--新测试过 80%+ 却未全过

实操策略：先 Kimi，再升级到 Sol
推荐级联：
1. 先跑 Kimi
2. 验证器不过，再升级到 Sol

结果：85.6% 解题率，约 $7.30 / 任务--比单独用 Sol（约 72.3%、$8.37）覆盖高约 13 个百分点，成本还更低。

也可用领域分类器直接选型；线程评论里有人问路由器实现，Zain 的核心思路是「任务分类 / 验证器驱动升级」，而非复杂三模型编排。

### 引用推文

> Zain：Deepdive: Kimi K3 max vs. GPT 5.6 Sol max on software engineering/DeepSWE tasks. Both of these models provide nice specializations and routing/cascading between...
