DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。
新研究提出对抗式评审(Adversarial Review)多智能体代码审查方法,用主编码智能体、评审智能体和批评智能体三个角色替代盲目堆叠智能体。在LiveCodeBench上,三智能体方案超越五智能体基线;在SWE-PRBench上,显式要求分歧可恢复最高F1分数,而合作式评审仅在分歧小且有证据支撑时有效。
MerchantBench 让 LLM 智能体模拟经营网店一整年,涵盖选品、定价与现金流管理,并额外追踪智能体是否持续行动。最佳智能体全年营收仅约为人类水平的四分之一,且常以“沉默”方式达成,提示最终高分可能掩盖数月前就已停止运作的智能体。该基准强调按窗口记录行动频率并观察曲线,以识别长期连贯性缺陷。
AutoDesign 系统通过智能体在真实任务上运行、分析失误并自动重写提示词、工具、验证检查或重试规则,实现脚手架自动优化。在论文转会议海报任务中,七个智能体得分提升 5 至 19.6 点,最便宜模型获益最大,并发布 PosterBench 基准。研究表明,弱模型配良好脚手架可弥合与前沿模型的大部分差距,升级模型前应先优化现有代码。
GitSkills 数据集分析发现,GitHub 上 380 万个 agent 技能文件中超半数为完全重复副本,实际独立文件仅约 190 万。该格式缺乏注册表和包管理器,导致技能文件被复制后无法接收原作者修复。论文指出,编辑后的热门技能副本可能混入原始版本没有的命令或网络调用,整个数据集以单个 SQLite 文件发布,便于大规模核查。
论文指出,智能体安装技能后其描述会永久占用系统提示词,每个技能带来50至280 token的固定成本。研究认为单个智能体可靠触发技能数不足百个,而当前已发布技能达56,804个。建议仅将少数必须自动触发的技能常驻提示词,其余按需调用。
斯坦福和CMU提出Task Model Induction,将真实工作录屏拆解为独立任务并重建带循环的目标树,而非当作单一操作序列。该方法恢复了74.9%的实际操作,是现有最佳摘要器的两倍多,基于其构建的技能在未见任务上表现提升30%。研究指出,挖掘演示数据训练智能体时应输入目标结构而非原始转录。
微软发布论文指出,智能体“成功一次”不等于“可靠”:最佳智能体在业务任务中单次成功率 91%,但每次都能成功的比例仅 25%,因此需以重复测试衡量可靠性。研究发现 4/5 的失败运行会礼貌地调用写数据库工具并声称任务完成,但实际记录并未更新。为此微软构建 ThinkingBox 沙盒,让智能体在真实工具、模拟客户和实时后端上运行,事后检查数据库而非读取回复。
一项对1,902次AI编码智能体运行的研究发现,任务在2个和4个智能体时10次通过9次,但在8个智能体时全部失败。失败源于一个关于取整的规则落在两个智能体之间的决策空隙中,无人负责。研究提醒,添加智能体前应明确哪些决策会被推入协作间隙。
清华与康奈尔新研究指出,智能体记忆可能将可恢复错误固化为持续错误。论文借鉴数据库事务思想提出 ACID-Agent,将探索-执行-验证循环视为事务,仅提交验证通过的结果,失败尝试不进入记忆与工作区。验证失败时智能体重试且不携带失败状态,长期运行可靠性更取决于控制提交与重试而非单纯提升推理能力。
Apodex Discovery 推出 TRACES 基准,评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。它同时检查最终答案与外部可见轨迹,用 HDS6 盲评六种过程能力(工具、修复、备选解释、连贯性、证据、适用边界)。在 434 条缺陷轨迹上,加入修复说明使环境结果得分平均提高 0.155,但实验缺少匹配对照组。
斯坦福大学新研究发现,让AI智能体相互辩论能提升其确定性。团队运行超1万个由32个不同人格智能体组成的小型社区,经8轮信息交流后,数学问题上错误多数派转向正确答案的频率高于正确派转向错误;政治议题上,4个模型中3个出现右倾趋势。研究建议,若系统采用智能体辩论机制,应追踪群体漂移方向,而非仅看分数提升。
一篇新论文分析大量公开的后训练轨迹,发现智能体在第一步就锁定训练策略,剩余预算全用于局部调整,无法真正实现递归自我改进。研究者尝试三种升级方案:经验驱动脚手架在GSM8K提升12.6分、HumanEval提升40.8分,但策略仍冻结;人类引导和额外推理算力均未解决根本问题。核心缺失是智能体在执行中缺乏重新考虑策略的能力。
东京大学新论文指出,多数AI智能体评测测试浪费资金——所有版本都能通过或都无法通过的任务占测试集超70%,却与其他测试成本相同。新方法Task-CoEvolve仅保留过往版本有分歧的测试,每轮重新选取,并调整评分以跨轮比较。在Terminal-Bench 2.1上,仅用89项任务中20%进行评测,结果与全量评测相差约一项任务,成本降低67%-80%,时间减半。
一篇关于AI智能体的论文指出,LLM的错误假设导致幻觉、成本低效和不可靠工具调用等问题。该研究将上下文获取定义为对潜在任务状态的主动推理,提出“最优提问”(Optimal Question Asking)方法,用动态规划基准测试前沿模型在25至300个候选任务上的表现,可衡量智能体与理论最优的差距。
TRACES 是 Apodex Discovery 框架下的现实基准,评估 AI 系统能否通过有证据支撑、可审计且可修复的调查研究得出正确结果。在临床试验复现案例中,修复后的过程评分从 0.83 升至 0.95,而数字未变。该基准区别于仅测最终答案的传统基准,将评估对象从答案扩展至完整调查链:目标→规划→行动→观察→验证→修复。
ClawGym II 框架将 OpenClaw 或 Claude Code 作为黑盒纳入 RL 训练循环,无需访问其内部机制。通过 Qwen3-30A3B,该方法在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分,混合训练亦有效,并扩展至 JobBench 和 OfficeQA。
一项针对 LLM 作为合成调查受访者的心理测量学审计发现,LLM 能复现人类调查结果的大致方向,但无法还原真实的人类回答分布。用 LLM 生成数据训练的模型在预测真实人类时平均 R² 为 -0.18,而用人类数据训练的模型为 0.28。论文认为 LLM 仅适用于低成本试点调查,不能替代真实受访者。
清华等高校论文发现,AI智能体可优化训练计划数小时,却很少意识到计划本身有误。在1,338条后训练轨迹中,3,557个相邻实验仅74个(2.1%)改变了高层策略,多数迭代停留在同一方法内调整数据、超参数等。加入实验日志、技能库和评估器虽使GSM8K提升12.6分、HumanEval提升40.8分,但仍未触发策略变更;2–8倍推理token也几乎未带来AIME 2025可靠增益。
哈佛与斯坦福新论文建议,勿用LLM替代嵌入模型做首轮检索,仅在需要推理时引入LLM。同等质量下LLM成本最高达嵌入模型的1,431倍:Gemini 3.1 Pro在37项任务中得分77.6,与Octen-8B的77.2统计持平,但成本为$154.14对$0.11。LLM在检索任务领先8.5分,嵌入模型在分类任务领先5.6分,建议嵌入模型负责候选检索,LLM仅处理需推理的短名单。
一篇新论文提出“框架持续学习”(HCL)框架,指出智能体无需重训模型,仅通过重写自身提示词、记忆和路由即可实现行为更新。论文将模型冻结而周边行为持续变化的现象称为“框架级遗忘”,并主张对提示词、记忆、技能和路由的改动应像代码变更一样进行回归测试后再持久化。
Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。
一项新论文重新评估了基于记忆的自我改进智能体,发现其增益可能源于评估噪声。研究补充了先前工作忽略的两点:多次运行测量方差和随机打乱任务顺序,两者均显著降低性能。默认任务顺序隐含的课程学习是报告增益的主要来源,添加详细评分标准与环境反馈可部分恢复性能,但差距仍明显。
一篇关于智能体框架持续学习的新论文指出,现代智能体在提示词、记忆、工具等框架组件中积累经验,更新任一组件可能导致模型未变但行为失效,即“框架级遗忘”。论文提出“受保护的框架演化”机制,由持续优化器生成候选框架、持续评估器在确认改进、历史保留和有效性后才提交,在文本推理、多模态感知和开放世界交互中相对提升超10%。
一篇立场论文主张,科学智能体应作为“科学家+智能体”的人机协作系统来评估,而非孤立优化智能体本身。在10项科学任务中,GPT-5-mini几乎从不主动请求人类帮助,但专家能发现智能体遗漏的错误,而智能体加速执行——增益来自协作而非自主性。论文提出以人机团队是否比任何单独一方产出更好科学为基准。
一篇新论文系统检验了智能体能否后训练其他智能体,分析大量公开后训练轨迹后发现:智能体在第一步就锁定训练策略,剩余预算全部用于局部调整。三种干预措施中,经验驱动脚手架在GSM8K提升12.6分、HumanEval提升40.8分,但策略仍不改变;人类引导仅重定向初始选择,额外推理算力对最难任务几乎无效。核心缺失是执行中无法重新考虑策略的能力。
斯坦福新论文发现,企业智能体基准测试中,不到3%的分数差异源于智能体本身,7–23%来自智能体与具体任务的交互。在τ2-bench最难任务上,可靠性从0.752骤降至0.000;50组训练/测试分割中,预测可靠性与实际可靠性相关系数为r=-0.90。排行榜看似精确,却难指导实际工作流选择。
ClawGym II 将 RL 训练置于 OpenClaw 和 Claude Code 等现有框架之上,通过服务代理捕获框架的每次调用并组织成前缀树,使 PPO 和 GRPO 能优化恢复的多轮结构。
新研究发现,LLM智能体并未真正理解或应用抽象经验规则,而是仅依赖原始历史日志进行模仿。实验通过篡改存储内容验证:破坏逐步历史记录导致AI性能大幅下降,而完全破坏总结规则却无任何性能损失。这表明当前AI系统更多是模仿而非真正推理学习,引发对行业记忆机制设计的重新思考。
一项研究揭示 Agent Skills 有效的核心原因:将杂乱的过往经验提炼为清晰流程,而非简单存储更多执行细节。实验对比中,使用蒸馏后的 SKILL.md 比保留完整执行细节的 Workflow Memory 性能高出 6.06 个百分点。轨迹分析显示,65.7% 的成功案例依赖程序性锚定,仅 4.5% 靠补充缺失知识,说明技能主要优化执行顺序与工具选择,但误用或僵化遵循反而有害。
哈佛与芝加哥团队分析 9,174 个模型、6.12B 次请求的一年生产数据,发现高效 LLM 服务更依赖理解流量变化与重复模式,而非单一调度器。99% 的缓存复用来自 15 分钟内的重复请求,均匀负载均衡会削弱该优势。研究建议路由、缓存与容量规划应基于真实流量历史,而非短时或合成基准。
How many agent skills are actually out there? There are ~3.8M SKILL.md files across 282,200 public GitHub repositories, ...
宾夕法尼亚大学新论文发现,AI智能体在长会话压缩后常遗忘用户设定的规则,却仍记得任务本身。在3种长上下文设置中,现有压缩器平均仅保留17%的会话规则。简单修复方案是使用独立的9B参数提取器在压缩后恢复规则,使保留率提升至90%以上。