Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验,让 K3 优化自己运行的框架「Cline harness」
连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升到 88.8%,成本也从 $79 下降到了 $49.8
我对「递归式自我改进(Recursive Self Improvement)」这个标题还是有些疑问,有些唬人!
相比于 Coding Agent 直接帮我们在项目中改代码,这个实验更进一步的点是「闭环」,从分析失败日志 → 形成假设 → 修复 → 验证的迭代循环。
Kimi K3 运行在 Cline harness 之下,对要实现哪些目标很确定、中间产生了哪些行为和数据也很清楚,就会有更完整的记录到修复的循环依据。
对我们用 Coding Agent 做产品优化确实也有启发,就是不能只看代码、只跑单测,让 Agent 进入正常运行循环中,接收到更明确的目标,更有利于搞定任务。