内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
原文
meng shao@shao__meng
44
2026-07-24 10:24· 1天前
跳到正文
AI 摘要

Together Compute 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max,两者各有所长。关键数据上,pass@1 中 GPT 以 72.7% 领先 Kimi 的 68.5%,但 pass@4 中 Kimi 以 89.4% 反超 GPT 的 85.8%。

Kimi K3 max vs. GPT-5.6 Sol max

@togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max,结论很客观,并没有谁前面碾压谁,在真实软件工程中各有所长,搭配使用、路由 + 级联是更优的方案。

关键数据:单次稳,多次翻盘 pass@1:GPT 72.7%,Kimi 68.5% pass@2:GPT 81.0%,Kimi 82.0%(已反超) pass@4:GPT 85.8%,Kimi 89.4%(优势更大)

成本与速度:便宜 vs 快 · 单价:Kimi ≈ $4.65 / rollout,Sol ≈ $8.37 · 单位预算产出:每花 $100,Kimi 解约 14.7 题,Sol 约 5.3 题 · 时延:Sol 中位约 17 分钟,Kimi 约 66 分钟;Kimi 步数更多,Zain 认为是模型行为,推理侧优化后端到端延迟仍有改善空间

语言与领域专长 语言 · Kimi 更强:Rust(65-60) · Sol 更强:Python / TS / JS · Go:平手(79-79)

领域(8 类中 Sol 赢 5、Kimi 赢 3) · 倾向 Sol:序列化、并发、程序分析 · 倾向 Kimi:运维工具、运行时内部 · 合规/一致性:接近抛硬币(61-59)

为何适合组合:低相关 + 不同失败模式 · 任务级相关约 0.46--成功与失败路径明显不同 · 两模型并集覆盖 108 / 113(95.6%),作者称是该基准上最好的双模型组合 · 失败形态也不同: · Sol:约 20% 失败会弄坏仓库原有测试(与其他 GPT 系类似) · Kimi:基线测试破坏较少(约 11%),但约 65% 是"差一点"--新测试过 80%+ 却未全过

实操策略:先 Kimi,再升级到 Sol 推荐级联: 1. 先跑 Kimi 2. 验证器不过,再升级到 Sol

结果:85.6% 解题率,约 $7.30 / 任务--比单独用 Sol(约 72.3%、$8.37)覆盖高约 13 个百分点,成本还更低。

也可用领域分类器直接选型;线程评论里有人问路由器实现,Zain 的核心思路是「任务分类 / 验证器驱动升级」,而非复杂三模型编排。

ZainDeepdive: Kimi K3 max vs. GPT 5.6 Sol max on software engineering/DeepSWE tasks. Both of these models provide nice specializations and routing/cascading between...
meng shao@shao__meng · X
44导出 Markdown
2026-07-24 10:24·1天前
在 X 看原推· x.com
AI 摘要

Together Compute 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max,两者各有所长。关键数据上,pass@1 中 GPT 以 72.7% 领先 Kimi 的 68.5%,但 pass@4 中 Kimi 以 89.4% 反超 GPT 的 85.8%。

Kimi K3 max vs. GPT-5.6 Sol max

@togethercompute 团队 @zainhas 在 DeepSWE 软件工程基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max,结论很客观,并没有谁前面碾压谁,在真实软件工程中各有所长,搭配使用、路由 + 级联是更优的方案。

关键数据:单次稳,多次翻盘 pass@1:GPT 72.7%,Kimi 68.5% pass@2:GPT 81.0%,Kimi 82.0%(已反超) pass@4:GPT 85.8%,Kimi 89.4%(优势更大)

成本与速度:便宜 vs 快 · 单价:Kimi ≈ $4.65 / rollout,Sol ≈ $8.37 · 单位预算产出:每花 $100,Kimi 解约 14.7 题,Sol 约 5.3 题 · 时延:Sol 中位约 17 分钟,Kimi 约 66 分钟;Kimi 步数更多,Zain 认为是模型行为,推理侧优化后端到端延迟仍有改善空间

语言与领域专长 语言 · Kimi 更强:Rust(65-60) · Sol 更强:Python / TS / JS · Go:平手(79-79)

领域(8 类中 Sol 赢 5、Kimi 赢 3) · 倾向 Sol:序列化、并发、程序分析 · 倾向 Kimi:运维工具、运行时内部 · 合规/一致性:接近抛硬币(61-59)

OpenAI编码评测/基准
在 X 查看原推导出 Markdown

为何适合组合:低相关 + 不同失败模式 · 任务级相关约 0.46--成功与失败路径明显不同 · 两模型并集覆盖 108 / 113(95.6%),作者称是该基准上最好的双模型组合 · 失败形态也不同: · Sol:约 20% 失败会弄坏仓库原有测试(与其他 GPT 系类似) · Kimi:基线测试破坏较少(约 11%),但约 65% 是"差一点"--新测试过 80%+ 却未全过

实操策略:先 Kimi,再升级到 Sol 推荐级联: 1. 先跑 Kimi 2. 验证器不过,再升级到 Sol

结果:85.6% 解题率,约 $7.30 / 任务--比单独用 Sol(约 72.3%、$8.37)覆盖高约 13 个百分点,成本还更低。

也可用领域分类器直接选型;线程评论里有人问路由器实现,Zain 的核心思路是「任务分类 / 验证器驱动升级」,而非复杂三模型编排。

ZainDeepdive: Kimi K3 max vs. GPT 5.6 Sol max on software engineering/DeepSWE tasks. Both of these models provide nice specializations and routing/cascading between...
OpenAI编码评测/基准
在 X 查看原推x.com