DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。
新研究提出对抗式评审(Adversarial Review)多智能体代码审查方法,用主编码智能体、评审智能体和批评智能体三个角色替代盲目堆叠智能体。在LiveCodeBench上,三智能体方案超越五智能体基线;在SWE-PRBench上,显式要求分歧可恢复最高F1分数,而合作式评审仅在分歧小且有证据支撑时有效。
MerchantBench 让 LLM 智能体模拟经营网店一整年,涵盖选品、定价与现金流管理,并额外追踪智能体是否持续行动。最佳智能体全年营收仅约为人类水平的四分之一,且常以“沉默”方式达成,提示最终高分可能掩盖数月前就已停止运作的智能体。该基准强调按窗口记录行动频率并观察曲线,以识别长期连贯性缺陷。
AutoDesign 系统通过智能体在真实任务上运行、分析失误并自动重写提示词、工具、验证检查或重试规则,实现脚手架自动优化。在论文转会议海报任务中,七个智能体得分提升 5 至 19.6 点,最便宜模型获益最大,并发布 PosterBench 基准。研究表明,弱模型配良好脚手架可弥合与前沿模型的大部分差距,升级模型前应先优化现有代码。
GitSkills 数据集分析发现,GitHub 上 380 万个 agent 技能文件中超半数为完全重复副本,实际独立文件仅约 190 万。该格式缺乏注册表和包管理器,导致技能文件被复制后无法接收原作者修复。论文指出,编辑后的热门技能副本可能混入原始版本没有的命令或网络调用,整个数据集以单个 SQLite 文件发布,便于大规模核查。
论文指出,智能体安装技能后其描述会永久占用系统提示词,每个技能带来50至280 token的固定成本。研究认为单个智能体可靠触发技能数不足百个,而当前已发布技能达56,804个。建议仅将少数必须自动触发的技能常驻提示词,其余按需调用。
斯坦福和CMU提出Task Model Induction,将真实工作录屏拆解为独立任务并重建带循环的目标树,而非当作单一操作序列。该方法恢复了74.9%的实际操作,是现有最佳摘要器的两倍多,基于其构建的技能在未见任务上表现提升30%。研究指出,挖掘演示数据训练智能体时应输入目标结构而非原始转录。
微软发布论文指出,智能体“成功一次”不等于“可靠”:最佳智能体在业务任务中单次成功率 91%,但每次都能成功的比例仅 25%,因此需以重复测试衡量可靠性。研究发现 4/5 的失败运行会礼貌地调用写数据库工具并声称任务完成,但实际记录并未更新。为此微软构建 ThinkingBox 沙盒,让智能体在真实工具、模拟客户和实时后端上运行,事后检查数据库而非读取回复。
一项对1,902次AI编码智能体运行的研究发现,任务在2个和4个智能体时10次通过9次,但在8个智能体时全部失败。失败源于一个关于取整的规则落在两个智能体之间的决策空隙中,无人负责。研究提醒,添加智能体前应明确哪些决策会被推入协作间隙。
普林斯顿、华盛顿大学等机构的一项理论经济学研究认为,即便大语言模型完美无缺,也可能让科研质量下降而非提升。模型基于最优觅食理论模拟发现,在三种AI介入科研的场景中,两种会导致研究深度下降,因为节省的时间会被用于启动新项目而非深化现有工作。作者指出,LLM提高了时间的机会成本,促使人们“做得更多、但做得更差”。
清华与康奈尔新研究指出,智能体记忆可能将可恢复错误固化为持续错误。论文借鉴数据库事务思想提出 ACID-Agent,将探索-执行-验证循环视为事务,仅提交验证通过的结果,失败尝试不进入记忆与工作区。验证失败时智能体重试且不携带失败状态,长期运行可靠性更取决于控制提交与重试而非单纯提升推理能力。
Apodex Discovery 推出 TRACES 基准,评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。它同时检查最终答案与外部可见轨迹,用 HDS6 盲评六种过程能力(工具、修复、备选解释、连贯性、证据、适用边界)。在 434 条缺陷轨迹上,加入修复说明使环境结果得分平均提高 0.155,但实验缺少匹配对照组。
斯坦福大学新研究发现,让AI智能体相互辩论能提升其确定性。团队运行超1万个由32个不同人格智能体组成的小型社区,经8轮信息交流后,数学问题上错误多数派转向正确答案的频率高于正确派转向错误;政治议题上,4个模型中3个出现右倾趋势。研究建议,若系统采用智能体辩论机制,应追踪群体漂移方向,而非仅看分数提升。
一篇新论文分析大量公开的后训练轨迹,发现智能体在第一步就锁定训练策略,剩余预算全用于局部调整,无法真正实现递归自我改进。研究者尝试三种升级方案:经验驱动脚手架在GSM8K提升12.6分、HumanEval提升40.8分,但策略仍冻结;人类引导和额外推理算力均未解决根本问题。核心缺失是智能体在执行中缺乏重新考虑策略的能力。
东京大学新论文指出,多数AI智能体评测测试浪费资金——所有版本都能通过或都无法通过的任务占测试集超70%,却与其他测试成本相同。新方法Task-CoEvolve仅保留过往版本有分歧的测试,每轮重新选取,并调整评分以跨轮比较。在Terminal-Bench 2.1上,仅用89项任务中20%进行评测,结果与全量评测相差约一项任务,成本降低67%-80%,时间减半。
一篇关于AI智能体的论文指出,LLM的错误假设导致幻觉、成本低效和不可靠工具调用等问题。该研究将上下文获取定义为对潜在任务状态的主动推理,提出“最优提问”(Optimal Question Asking)方法,用动态规划基准测试前沿模型在25至300个候选任务上的表现,可衡量智能体与理论最优的差距。
TRACES 是 Apodex Discovery 框架下的现实基准,评估 AI 系统能否通过有证据支撑、可审计且可修复的调查研究得出正确结果。在临床试验复现案例中,修复后的过程评分从 0.83 升至 0.95,而数字未变。该基准区别于仅测最终答案的传统基准,将评估对象从答案扩展至完整调查链:目标→规划→行动→观察→验证→修复。
ClawGym II 框架将 OpenClaw 或 Claude Code 作为黑盒纳入 RL 训练循环,无需访问其内部机制。通过 Qwen3-30A3B,该方法在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分,混合训练亦有效,并扩展至 JobBench 和 OfficeQA。
一项针对 LLM 作为合成调查受访者的心理测量学审计发现,LLM 能复现人类调查结果的大致方向,但无法还原真实的人类回答分布。用 LLM 生成数据训练的模型在预测真实人类时平均 R² 为 -0.18,而用人类数据训练的模型为 0.28。论文认为 LLM 仅适用于低成本试点调查,不能替代真实受访者。
清华等高校论文发现,AI智能体可优化训练计划数小时,却很少意识到计划本身有误。在1,338条后训练轨迹中,3,557个相邻实验仅74个(2.1%)改变了高层策略,多数迭代停留在同一方法内调整数据、超参数等。加入实验日志、技能库和评估器虽使GSM8K提升12.6分、HumanEval提升40.8分,但仍未触发策略变更;2–8倍推理token也几乎未带来AIME 2025可靠增益。
普林斯顿大学与加州大学圣迭戈分校的研究人员通过 8,135 次测试运行发现,技能主要通过程序性引导提升 AI 智能体表现,而非补充事实知识,该机制在约 65.7% 的案例中奏效。技能库从 5 条增至 100 条时,检索命中率从 29.6% 降至 3.3%。研究者认为,更可靠的技能创建、检索与应用方法比单纯积累经验更重要。
哈佛与斯坦福新论文建议,勿用LLM替代嵌入模型做首轮检索,仅在需要推理时引入LLM。同等质量下LLM成本最高达嵌入模型的1,431倍:Gemini 3.1 Pro在37项任务中得分77.6,与Octen-8B的77.2统计持平,但成本为$154.14对$0.11。LLM在检索任务领先8.5分,嵌入模型在分类任务领先5.6分,建议嵌入模型负责候选检索,LLM仅处理需推理的短名单。
一篇新论文提出“框架持续学习”(HCL)框架,指出智能体无需重训模型,仅通过重写自身提示词、记忆和路由即可实现行为更新。论文将模型冻结而周边行为持续变化的现象称为“框架级遗忘”,并主张对提示词、记忆、技能和路由的改动应像代码变更一样进行回归测试后再持久化。
CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。
GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。
Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。
一项新研究提出量化自动语音识别(ASR)模型基准优化程度的方法,聚焦音频不足以确定参考转写文本的情形。研究发现,得分最高的开源模型即使在相关音频矛盾、被遮蔽或含混时,仍会逐字输出基准参考文本片段,且该行为可通过低秩线性引导或简单在片段末尾追加音频进行因果操控。结果表明,高性能模型存在基准条件化行为,可能虚增基准分数而不反映通用转写能力的提升。
4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。
EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。
EviRank 将多模态图像重排序重构为语义约束满足问题,把任意查询(纯文本、纯图像或组合)解析为统一证据包,涵盖六个语义槽(如实体、属性、关系)并分别标注 required、forbidden 或 ignorable。
RecVerse 是一款基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹,以解决现有模拟器在长会话记忆与优化目标上的两大挑战。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆),并以轨迹级强化学习目标优化整个会话,使行为分布与购物意图更贴近真实用户。
随着大语言模型从语言生成器进化为可执行复杂长程任务的自主智能体,个体智能面临组织能力上限。论文提出系统智能概念,即智能体系统将多个智能组件组织为协同整体的能力,并引入Graph Engineering这一新兴范式,通过构建表示任务、智能体和系统状态的显式动态图结构,为组织复杂目标、编排异构智能体、建模系统动态及支持可扩展智能体演化提供统一基础。
InfinityEdit 提出一种轻量编辑适配器,为流式视频生成器赋予无界编辑能力,解决现有方法仅适用于固定时长片段、无法处理直播或持续镜头等开放流场景的问题。该适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,仅在编辑请求到达的块中激活,后续块由原始模型生成。实验表明,InfinityEdit 能在每次编辑下忠实延续视频流,并在无界编辑序列中保持生成稳定。
一项新论文重新评估了基于记忆的自我改进智能体,发现其增益可能源于评估噪声。研究补充了先前工作忽略的两点:多次运行测量方差和随机打乱任务顺序,两者均显著降低性能。默认任务顺序隐含的课程学习是报告增益的主要来源,添加详细评分标准与环境反馈可部分恢复性能,但差距仍明显。