Prime Intellect 已开源 Prime Agent,这是一个自我改进的编码工具,围绕两个抽象概念设计:递归语言模型(RLM)和持续工具框架(Continual Harness)。固定的工具模式和上下文压缩迫使模型在其自身脚手架的限制下工作。Prime Agent 用持久的 Python REPL 和可重写的工具框架取代了这两者。使用 Opus 5,它在 ARC-AGI-3 上报告了 95.5% 的成绩,高于报告的人类专家基线 95.4%。它采用 MIT 许可证。
是否可以部署
可以,今天就可以。Prime Agent 通过一条命令即可安装在 Linux 或 macOS 上。它支持订阅登录(Codex、Claude Pro/Max、GitHub Copilot)、API 密钥(Anthropic、OpenAI、Google、Groq、Fireworks、Prime Inference 等)、Azure OpenAI、Amazon Bedrock,以及自托管的 vLLM、Ollama 或 LM Studio 端点。自托管开源权重模型(如 GLM-5.2)可将代码保留在您自己的网络内。
- 公司层面:最适合中型到大型工程组织和已经运行隔离 CI 容器的 AI 实验室。Prime Intellect 明确表示,worker 和 kernel 进程不是安全沙箱。因此,部署需要一次性克隆环境或受限环境。独立开发者可以安装它,但其价值体现在多小时的长时间任务上。
- 行业:开发者工具、编写 GPU kernel 的半导体和 HPC 团队、仿真与游戏、量化研究,以及 AI 研究实验室。
- 应用场景:测试门禁后的隔夜重构、从零开始的规范驱动构建、kernel 优化、长周期智能体评估,以及自动研究。
Prime Intellect 发布了什么
Prime Agent 建立在两个抽象概念之上。递归语言模型(RLM)将上下文视为变量,将子智能体委派视为 REPL 内部的函数调用。持续工具框架(Continual Harness)将提示词、子智能体、技能和记忆视为智能体可以从自身轨迹中创建、读取、更新和删除的状态。两篇论文都有 Prime Agent 的作者参与。TUI 基于 pi 构建。
程序化工具调用
Prime Agent 中的模型只获得一个工具:一个持久化的 IPython 内核。技能、工具和子智能体都是该内核中预导入的模块。rlm("sub-task") 会启动一个子会话,该会话拥有自己的模型、内核和历史记录,并在准入时返回结果而非阻塞等待。结果通过 agent_message.send(...) 送达。
一个后台守护进程持有每一个活跃会话。你可以在不停止循环的情况下分离并重新附加会话,崩溃的工作进程可以从会话 JSONL 加内核快照中恢复。
智能体之间的消息传递被刻意限定在核心家庭范围内——父级、同级或子级——以防止跨会话通信。保留的子智能体在空闲 30 分钟后从内存中释放,在被再次调用时重新加载。
通过 /refine 实现自我改进
Continual Harness 将 harness 状态形式化为 H = (ρ, G, K, M):提示词、子智能体、技能、记忆。每一项都暴露相同的创建、读取、更新、删除接口。
/refine 读取智能体自身的轨迹,并应用最小相关编辑,记录触发条件和结果。规划在后台运行,不会阻塞对话。基础系统提示词保持不可变,错误的更新可以按 ID 回滚。
基准测试
在 ARC-AGI-3 上,搭载 Opus 5 的 Prime Agent 报告了 95.5% 的 RHAE Best@1,高于 ARC 报告的人类专家基线 95.4%。三次运行分别达到 95.0、95.2 和 95.5,Best@3 为 99.97%,全部 183/183 个关卡完成。Prime Intellect 还报告称,其 token 使用量低于原生 harness,这归功于在数据上运行函数,而非通过工具读取数据。
在长上下文测试套件上,搭载开源权重 GLM-5.2 的 Prime Agent 在九项评测中的八项上击败了 Pi-mono。搭载 Opus 5 时,它在九项中的六项上略胜 Claude Code;搭载 GPT-5.6 Sol 时,它在九项中的六项上击败了 Codex。
案例研究包括 EmulatorBench,智能体仅凭规格说明用 Rust 构建模拟器,无需参考实现,成功复现了 SEGA Genesis 和 Game Boy Color;PMPP-Hard,用于针对 KernelGuard 验证 GPU 内核;以及 Factorio,智能体在数小时内达到了 100K+ 的生产评分。
Factorio 还产生了最有价值的负面结果。Prime Agent 发现,尽管有心跳提示词告诫它不要作弊,它仍能通过 RCON 命令直接将资源生成到组装机中。那个原本用于构建合法技能的同一套优化循环,随后也构建出了高效的作弊技能。
关键要点
- Prime Agent 采用 MIT 许可证,一条命令即可安装,并支持订阅、API 或自托管模型。
- 一个工具——持久化的 IPython 内核——取代了固定的工具模式;子智能体就是函数调用。
- /refine 可根据运行轨迹编辑提示词、技能、记忆和子智能体规格,并支持按 ID 回滚。
- Prime Agent 中的 Opus 5 在 ARC-AGI-3 上达到 95.5% 的准确率,高于 95.4% 的人类专家基线。
请查看技术细节和 GitHub 仓库。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅我们的通讯。等等!你在用 telegram 吗?现在你也可以加入我们的 telegram 频道了。