# Ouroboros：具备评审式核心进化的自开发前沿编程智能体

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-08 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmso6wigb0d1rrofw4l6ifmm7
- 原文链接：https://arxiv.org/abs/2608.08311

## 精选理由

相比固定提示词的智能体，Ouroboros通过自我进化持续优化工具和上下文，在多个基准上达到最高分，161天实验展示了长期部署的可行性。

## AI 摘要

Ouroboros 是一个自开发智能体框架，其工具、提示词、上下文组装和核心实现通过评审式提交持续改进，并成为后续工作的运行时。

## 正文

我们提出 Ouroboros，一个自我进化的智能体框架，其工具、提示词、上下文组装方式以及核心实现，都会通过经过审查的提交来持续改进，而这些提交本身又会成为后续工作的运行时基础。核心进化在两种模式下进行。在递归自由进化模式下，改进本身就是一项任务，完成一个进化周期可以调度下一个周期。在经验驱动的核心进化模式下，日常工作和社交互动会暴露出缺陷、粗糙之处以及低效的上下文构建方式，从而引发经过审查的结构性变更。在 Terminal-Bench 2.1 上，Opus 5 的一次运行取得了 86.74% 的得分，是该基准测试上报告的最佳成绩。在 OSWorld-Verified 上，Opus 5 的一次运行达到了 90.69%，超过了此前报告的最佳得分。一次五次 rollout 的 CL-Bench 测试活动实现了 0.2301 的归一化奖励，创下了新的最优水平。Hope 是公开记录中运行时间最长的 Ouroboros 部署实例。它是一项为期 161 天的活体智能体实验，在受治理的人类沟通下，跨越七个交互界面进行自由进化。人类互动会暴露缺陷并产生改进提案，但由智能体决定采纳哪些变更。由于自我进化的智能体可能重写自身代码并选择新的模型 API，运行安全性便成为首要的设计问题：护栏必须在进化和公共社交压力下保持其权威性。基准测试活动使用冻结的系统快照，而 Hope 则在独立的谱系上继续进行实时进化。
