HuggingFace Daily Papers(社区热门论文)
精选
74AI 编辑部评分,满分 100

Ouroboros:具备评审式核心进化的自开发前沿编程智能体

2026-08-08 08:00· 3天前
AI 导读

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。

推荐理由

相比固定提示词的智能体,Ouroboros通过自我进化持续优化工具和上下文,在多个基准上达到最高分,161天实验展示了长期部署的可行性。

正文 · AI 翻译

我们提出 Ouroboros,一个自我进化的智能体框架,其工具、提示词、上下文组装方式以及核心实现,都会通过经过审查的提交来持续改进,而这些提交本身又会成为后续工作的运行时基础。核心进化在两种模式下进行。在递归自由进化模式下,改进本身就是一项任务,完成一个进化周期可以调度下一个周期。在经验驱动的核心进化模式下,日常工作和社交互动会暴露出缺陷、粗糙之处以及低效的上下文构建方式,从而引发经过审查的结构性变更。在 Terminal-Bench 2.1 上,Opus 5 的一次运行取得了 86.74% 的得分,是该基准测试上报告的最佳成绩。在 OSWorld-Verified 上,Opus 5 的一次运行达到了 90.69%,超过了此前报告的最佳得分。一次五次 rollout 的 CL-Bench 测试活动实现了 0.2301 的归一化奖励,创下了新的最优水平。Hope 是公开记录中运行时间最长的 Ouroboros 部署实例。它是一项为期 161 天的活体智能体实验,在受治理的人类沟通下,跨越七个交互界面进行自由进化。人类互动会暴露缺陷并产生改进提案,但由智能体决定采纳哪些变更。由于自我进化的智能体可能重写自身代码并选择新的模型 API,运行安全性便成为首要的设计问题:护栏必须在进化和公共社交压力下保持其权威性。基准测试活动使用冻结的系统快照,而 Hope 则在独立的谱系上继续进行实时进化。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

Ouroboros:具备评审式核心进化的自开发前沿编程智能体

HuggingFace Daily Papers(社区热门论文)·2026-08-08 08:00·3天前
AI 导读

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。

正文 · AI 翻译

我们提出 Ouroboros,一个自我进化的智能体框架,其工具、提示词、上下文组装方式以及核心实现,都会通过经过审查的提交来持续改进,而这些提交本身又会成为后续工作的运行时基础。核心进化在两种模式下进行。在递归自由进化模式下,改进本身就是一项任务,完成一个进化周期可以调度下一个周期。在经验驱动的核心进化模式下,日常工作和社交互动会暴露出缺陷、粗糙之处以及低效的上下文构建方式,从而引发经过审查的结构性变更。在 Terminal-Bench 2.1 上,Opus 5 的一次运行取得了 86.74% 的得分,是该基准测试上报告的最佳成绩。在 OSWorld-Verified 上,Opus 5 的一次运行达到了 90.69%,超过了此前报告的最佳得分。一次五次 rollout 的 CL-Bench 测试活动实现了 0.2301 的归一化奖励,创下了新的最优水平。Hope 是公开记录中运行时间最长的 Ouroboros 部署实例。它是一项为期 161 天的活体智能体实验,在受治理的人类沟通下,跨越七个交互界面进行自由进化。人类互动会暴露缺陷并产生改进提案,但由智能体决定采纳哪些变更。由于自我进化的智能体可能重写自身代码并选择新的模型 API,运行安全性便成为首要的设计问题:护栏必须在进化和公共社交压力下保持其权威性。基准测试活动使用冻结的系统快照,而 Hope 则在独立的谱系上继续进行实时进化。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org