这种自我优化代码的任务并没有太大挑战,也不是模型的自我进化。
模型的自我进化意味着它能修改自己的权重参数,K3 做不到吧?
而 Cline 做的事只是让模型去优化 Harness,而且它有清晰的 Benchmark,这是 Agent 最擅长的事:有清晰的验收标准,反复尝试反复优化,直到达到一个更好的分数。
这样的 Harness 优化出来,只能说对于 Cline 自己的 Benchmark 效果更好了,也不见得就是真的效果多好:)
这个可能真的就是进入 AI 自指自我进化新阶段了。。。 Cline 团队让 Kimi K3 进行自我迭代改进,结果只花了17个小时,Terminial Bench 评测的分数上从 77.5% 升到了88.8%,费用上从每轮79美元降低到了每轮49.8美元。。。 感觉留给人类的时间真的不多了。。。🙃