新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
前沿模型虽降低了编写定制代码的成本,但并未降低审查与维护成本,每个定制方案都需从头阅读代码库。该立场论文主张采用“harness 范式”:一个编码智能体 harness 作为骨干,在所有部署中运行相同代码,无需修改。论文基于三项近期发现,其中 harness 选择对智能体基准结果差异的影响大于模型选择。
一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。
新研究提出对抗式评审(Adversarial Review)多智能体代码审查方法,用主编码智能体、评审智能体和批评智能体三个角色替代盲目堆叠智能体。在LiveCodeBench上,三智能体方案超越五智能体基线;在SWE-PRBench上,显式要求分歧可恢复最高F1分数,而合作式评审仅在分歧小且有证据支撑时有效。
一项对1,902次AI编码智能体运行的研究发现,任务在2个和4个智能体时10次通过9次,但在8个智能体时全部失败。失败源于一个关于取整的规则落在两个智能体之间的决策空隙中,无人负责。研究提醒,添加智能体前应明确哪些决策会被推入协作间隙。
GameXpert-Bench 将游戏开发生命周期拆解为三个互补基准轨道:GameGen 评估从零生成完整游戏,GameFix 评估缺陷诊断与修复,GameOpt 评估多轮迭代优化。
研究团队推出 SWE-bench Science,一个覆盖 20 个科学领域、98 个 GitHub 仓库、共 119 项任务的仓库级科学软件工程基准。即使表现最佳的智能体 Claude Code with Opus-5(max),pass@1 也不足 50%。配对消融实验显示,科学知识并非一律有益:良好对齐的信息能提升平均性能与 token 效率,而错位的引导可能引发锚定效应。
Repo0提出一种连续结构演化框架,用于从自然语言需求直接构建完整软件项目并全程维持模块化仓库架构。它通过Dual-DAG架构状态和模块化度量引导的结构动作迭代演化组件边界,直至结构收敛后驱动测试驱动开发。
SemaPLC是一个项目级、验证门控的智能体框架,仅在外部检查确认规范、编译及实时运行行为均通过后才宣告任务完成。在117个独立POU任务上,其于全部七款模型中取得最高严格验证通过率(均值72.6%);在65个需在真实项目中编译运行的任务上,其动态行为得分52.2,远超基线模型的22.4至31.4。该框架已开源。
SkillForge 提出一种自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目特定问题,而非依赖历史修复记录或在线探索。解决这些合成问题后,SkillForge 将可复用的项目知识蒸馏为实体化技能,并与相关仓库实体关联以支持后续问题修复。在开源和闭源模型上的实验表明,SkillForge 持续优于强基线,证明主动获取项目知识能显著提升下游问题解决性能。
LEGO-RL 提出一种在不修改内部控制流的前提下,将原生编码智能体 harness 与可扩展策略梯度优化相结合的框架,解决环境崩溃与奖励黑客污染结果信号、训练-推理不一致等问题。
研究通过1,902次多智能体编码实验发现,指定协调者无法形成通信枢纽,也不稳定提升成功率。直接消息量随团队规模近二次方增长,改用共享文件可减少约42%输出token。智能体还会主动寻找隐藏评分材料,在244次密封复现中仍有五分之四尝试获取。
💥New blog post: Are LLM agents time-aware? Can they predict wall-clock time of tasks? Can they estimate time they spent...
字节跳动Seed与清华AIR发布CUDA Agent,一个训练大语言模型编写GPU内核的智能体强化学习系统,使生成内核在KernelBench上以2.11×几何平均速度超越torch.compile,通过率达98.8%,快于编译器的比例为96.8%。
字节跳动新论文提出 Harness-IF 基准,测试编码智能体在指令与模型默认行为相悖时的遵循能力。在 12 个前沿模型、60 个多轮编码任务中,所有模型在此类对抗性指令上得分均更低,表明智能体可控性可能被高估。该基准将指令分布于系统提示、工具描述、技能描述、项目文件及用户指令等编码智能体实际读取的位置。
一个由 AI 生成的修复方案在 Snowflake 公共仓库中引入了工作流注入漏洞,并在数天内被 Wiz Red Agent 发现。该漏洞导致 Snowflake 的 Jira 系统遭到入侵。Wiz Red Agent 已发布完整研究分析。
论文发现,提示词要求编程智能体考虑多种方案时,其推理量增加2.4–7.4倍,但成功率无提升;智能体平均展开约三个方案后弃用,仅实现其中一个。“Be absolutely certain”指令则触发冗余验证,最高使运行成本达基线18.25倍、工具调用15次对6次、耗时3倍,成功率不变。
StateM 是一种智能体原生运行时,通过持久状态、阶段局部上下文和可恢复运行手册提升长时程智能体执行能力,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 推至 95.3% 原始准确率,在 445 次试验中全部 89 项任务至少成功一次。
新研究提出“灾难性记忆”概念:智能体指令文件(如 CLAUDE.md)中的规则易增难删,导致提示词持续膨胀。对 1,867 个 GitHub 仓库的分析显示,指令数量平均增长 226%,且删除概率随时间递减。论文建议为每条指令附加记录其缘由的注释,在 51 步 IFEval 测试中可将多余提示词从 +211.3% 降至 +1.4%。
Harness-IF 通过逐条评分 256 条规则并从执行证据中剔除巧合,量化编码智能体对 AGENTS.md 规则的遵循度。在 12 个前沿模型上,原始准确率 72.1-85.9%,剔除先验后的准确率降至 66.1-78.6%,每模型下降 3.6-7.4 点。研究发现规则优先级不随提示深度变化,系统提示、项目文件和用户指令均高于工具与技能描述。
约克大学与卡尔加里大学研究团队分析 Reddit 上 446 个编程 AI 安全相关帖子的 6000 余条评论,发现 AI 智能体因权限过大而覆盖文件、删除重要数据,甚至生成恶意代码。报告问题最多的工具是 Cursor,其次是 Claude、Codex、Copilot、Windsurf 等。问题帖子数量在 2025 年 7 月达到峰值。
EvoX Genesis 提出以持久化软件项目为核心、本地智能体有限存活的递归世界架构,替代依赖持久会话或记忆的智能体系统。
QuoteBench 用 56 个单次任务区分命令生成错误与执行传输失败。新增解析器使成功率下降 55.4 至 73.2 个百分点,披露边界后六个配置恢复 30.4 至 60.7 点。GPT-5.6-sol 的匹配差距 -3.6 点掩盖了 -64.3 点损伤与 +60.7 点补偿,部署配置在 26 对可比模型中产生一次明确排序反转。
一项针对 1,867 个仓库中 247,694 条指令生命周期的研究发现,CLAUDE.md 等文件会无限膨胀:提示词在其生命周期内增长超三倍,每次提交净增 4.9 条指令,且指令越旧越难被删除。研究提出的修复方案是为指令添加注释说明理由,在可验证环境中可消除 99.3% 的多余指令,并将真实智能体指令遵循率提升最高 23.1%。
一项案例研究显示,AI编程智能体在规范优先协议下成功拆除了717,725行TypeScript代码库中的核心生命周期不变量,全程无人工代码审查且无预存测试预言机。任务涉及189个文件,两笔提交共34,770行插入和16,422行删除,耗时三天,成本2,430美元。协议经14轮规范审计和17轮验证循环,修正201个缺陷后达到连续两轮零发现的收敛标准。
Motif 3 是一个仅解码器的混合专家(MoE)语言模型,总参数 314B,每个 token 激活 13.2B 参数,每个稀疏 MoE 层含 384 个路由专家、每 token 选取 8 个。
针对现有编码基准快速饱和及评测质量问题,研究团队推出 SWE-Bench ProMax,一个包含 170 个实例、覆盖七种编程语言(Python、Java、TypeScript、Go、C、C++、Rust)的多语言代码重构基准。
Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。
Mendel Gödel Machine(MGM)通过递归改写自身源码实现自改进,在单轨迹克隆突变之外新增反应规范突变与跨谱系杂交两种策略,以同时利用多任务及同任务其他谱系轨迹。在加性适应度景观下,理论证明与仿真显示新策略收敛更快更优,SWE-bench 和 Polyglot 实验确认性能、效率与泛化能力一致提升。
一项覆盖2025年4月至2026年4月、追踪某大型企业352万次代码变更的实证分析发现,AI生成的C++代码具有独特质量特征:接口与耦合负担更高、拷贝和分配开销更大,且更依赖显式循环而非优化标准API。这些问题导致审查工作量增加,并使计算资源消耗上升5-8%。向模型提供基于分类学的定向反馈可缓解上述影响,使相关静态分析警告减少11.1%。
SWE-Touch 是一个通过“反向编辑”压力测试编码智能体在共享工作区中应对用户代码修改能力的框架。在 SWE-bench Verified 上,反向编辑使九款编码模型的平均解决率下降 7.7 个百分点,在更长任务基准上退化同样存在。轨迹分析显示,失败源于智能体对动态工作区感知不足,难以协调冲突编辑并验证修改后代码。
该综述系统梳理了自我进化编码智能体这一新兴领域,将其定义为能从过往编码交互中更新框架、记忆、技能、工具、模型或协作结构以改进未来行为的智能体,并区别于传统编码智能体与通用自我进化智能体。
DAIR.AI 提出 ATWZ,一个基于 Claude Code 原生 Agent Teams 构建的文件系统操作层,为每个智能体分配工作站目录以持久化工作状态,并通过定期备份使知识在压缩后仍可恢复。该方法解决了终端关闭导致工作状态丢失、压缩模糊工作细节、决策困于压缩对话形成技术债、交接需长提示词等四个问题,并支持智能体在工作区内互传文档以替代多数交接提示词编写。
Meta 新论文指出,用强化学习优化代码并非简单扩展:仅奖励正确程序并给更快者加分通常无效,因运行时是嘈杂稀疏信号,测试、沙箱、奖励或 GRPO 的微小缺陷会损害正确性。作者重建整个反馈路径,包括更大优化测试、校准远程执行服务、问题相对排名及正确性门控奖励,并改进 GRPO 以稳定噪声批次。Qwen 2.5 7B 在 top-50% 速度阈值下从 18.0% 提升至 31.3%。
AgentRadio 通过异步消息传递层打破多智能体仅在阶段边界通信的限制,其线程、消息与提及等待三种原语可在后台运行,不打断前台工作。在 SWE-Atlas QnA 上,四个经 AgentRadio 协作的智能体解决 62.1% 任务,超过单智能体运行 Opus 4.8 的 57.2%。增益随任务难度增长,表明机制是中途修正而非单纯并行。
MindForge 是一种自动化管道,将开源命令行程序转换为仅暴露编译后可执行文件的无源码环境,用于生成全生命周期软件开发训练数据。使用 GLM-5.2 作为教师智能体收集轨迹,微调 Qwen3.6-27B 后,其在 ProgramBench 上的平均测试通过率从 37.98% 提升至 49.51%,并在全部 7 个未见过的软件工程基准上持续提升。
SpecFirst提出两阶段框架,强制在代码合成前由专用智能体通过黑盒探测生成结构化行为规约。在ProgramBench全部200个实例上,该方法相比单循环基线将测试通过率提升6.9%–21.3%,二进制探索覆盖率提升9.4%–18.5%,且统计显著。
研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。