# Kimi K3 递归自改进：17小时提升至88.8%

- 来源：meng shao (@shao__meng)
- 发布时间：2026-07-30 10:50
- AIHOT 分数：43
- AIHOT 链接：https://aihot.virxact.com/items/cms6xcbau02t4rouq0lg71u0e
- 原文链接：https://x.com/shao__meng/status/2082660157809680642

## AI 摘要

Cline 团队让 Kimi K3 对自身运行的 Cline harness 框架进行递归式自我改进实验。连续运行 17 小时后，Terminal-Bench 2.1 基准从 77.5% 提升至 88.8%，运行成本从 $79 降至 $49.8。该实验的关键在于形成“分析失败日志→形成假设→修复→验证”的闭环迭代，而非仅修改代码。

## 正文

Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验，让 K3 优化自己运行的框架「Cline harness」

连续运行 17 小时后，Terminal-Bench 2.1 基准从 77.5% 提升到 88.8%，成本也从 $79 下降到了 $49.8

我对「递归式自我改进（Recursive Self Improvement）」这个标题还是有些疑问，有些唬人！

相比于 Coding Agent 直接帮我们在项目中改代码，这个实验更进一步的点是「闭环」，从分析失败日志 → 形成假设 → 修复 → 验证的迭代循环。

Kimi K3 运行在 Cline harness 之下，对要实现哪些目标很确定、中间产生了哪些行为和数据也很清楚，就会有更完整的记录到修复的循环依据。

对我们用 Coding Agent 做产品优化确实也有启发，就是不能只看代码、只跑单测，让 Agent 进入正常运行循环中，接收到更明确的目标，更有利于搞定任务。

### 引用推文

> Cline：We had Kimi K3 recursively self-improve the Cline harness to improve its own performance. 17 hours later, it went from 77.5% to 88.8% on Terminal Bench, and cut...
