跳到主内容
@wquguru
精选70meng shao产品发布/更新

Kimi K3 递归自我改进实验:17小时提升基准至88.8%

Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验,让 K3 优化自己运行的框架「Cline harness」

原文
发到 X

Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验,让 K3 优化自己运行的框架「Cline harness」

连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升到 88.8%,成本也从 $79 下降到了 $49.8

我对「递归式自我改进(Recursive Self Improvement)」这个标题还是有些疑问,有些唬人!

相比于 Coding Agent 直接帮我们在项目中改代码,这个实验更进一步的点是「闭环」,从分析失败日志 → 形成假设 → 修复 → 验证的迭代循环。

Kimi K3 运行在 Cline harness 之下,对要实现哪些目标很确定、中间产生了哪些行为和数据也很清楚,就会有更完整的记录到修复的循环依据。

对我们用 Coding Agent 做产品优化确实也有启发,就是不能只看代码、只跑单测,让 Agent 进入正常运行循环中,接收到更明确的目标,更有利于搞定任务。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近