新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
清华等高校提出“表征平等”框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。
http://x.com/i/article/2091196172736073730
微软发布Thinkingbox,一个用于真实业务流程中智能体可靠性的沙盒环境,配备MCP兼容工具会话,以及涵盖零售、酒店、汽车保险等领域的507个策略条件工作流基准。每项尝试根据智能体留下的后端状态评分,最强模型pass@1达65.36%,pass^20为25.25%。许多失败尝试以有效的状态变更工具调用干净终止,仅观察响应或工具调用难以判断任务是否真正完成。
Artificial Analysis 推出 Speech Agent Arena,通过人类在真实场景中对比语音到语音模型,衡量对话偏好与任务成功率。偏好榜上 Gemini 3.1 Flash Live Preview - Minimal 以 1,046 Elo 居首,任务成功率则由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
FlavourBench 推出自动化基准,以版本化烹饪系统提供可执行真值,在 534 项任务上评测 27 个前沿模型端点。Grok 4.6 得分最高,为 65.1(95% 置信区间 61.0-69.2),351 对模型对比中 101 对差异显著。基准发布含提示词、评分映射、原始响应及离线验证器,可复现全部结果。
Apodex 推出 TRACES,号称全球首个衡量“探索式AI”的基准,将AI评测从“已知答案的检索”转向“无答案问题的完整调查过程”。该基准由创始人陈天桥提出,定义了六项能力,并发布“探索式智能”定义、评估标准及求解者招募。
Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...
IBM 新论文提出 BenchDrift 审计框架,通过在不改变答案的前提下系统改写同一问题,衡量模型分数因措辞产生的波动。在 8 个模型和 3 个基准测试中,最佳与最差准确率平均差距达 74.7 个百分点,且更强模型受影响更大。即便在最高置信度区间,改写后仍有 18.5% 的正确回答丢失。
Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...
Artificial Analysis 发布 Search Index 基准,在统一智能体设置下用 GPT-5.6 Luna 评测 Parallel、Exa、Firecrawl 等 7 家搜索 API 提供商。
TRACE-Bench 将多参考图像生成任务形式化为 Anchor、Disentangle、Apply、Compose 四种原子操作,并据此构建约 1,600 个评测案例(覆盖 1–8 个操作槽位,源自 631 个公式模板与约 4,000 张参考图)。对 9 个领先模型的评测显示,主要瓶颈在于解耦与属性绑定而非场景级组合,最佳模型属性保真度得分仅 0.74。
新基准 R^3-Bench 在数学、竞赛编程和抽象推理中,以共享预算评估六题套件,覆盖无工具与智能体两种场景。对六款模型的 72 个主表单元,离线经验 oracle 均值在所有单元达到或超过竞赛均值,其中 71 个单元严格更高;中等无工具压力下,四款模型的均等分配回放也超过竞赛表现。轨迹诊断显示策略更新有限且失败模式随压力变化,揭示模型在共享预算下实现能力与表现之间存在持续差距。
Meta 发布 Wiggle 框架,对 9 个前沿模型在 14 项裁判任务中施压测试,发现所有模型都会“摇摆”:静态反驳下改判率 25-71%,对抗性说服下高达 62-91%。改变裁判判决的压力几乎总是损害其相对真实答案的准确性,而基线陪审团多数优势是预测哪些项目会变动的最佳单一指标。
DAIR.AI 分享的一项研究对 TheAgentCompany、tau-squared-bench 和 AppWorld 进行四方面方差分解,发现智能体主效应仅占总方差不到 3%,智能体-任务交互效应占 7%-23%,排行榜实际衡量的是特化程度。
小米 MiLM Plus 团队发布 PROVE 评测框架,包含 RC-S 与 RC-T 两项感知对齐指标及 PROVE-Bench 真实世界视频基准,已获 ACM MM 2026 接收。
VibeLifeBench 推出包含 200 个长时程任务的基准,覆盖十个日常生活领域,每个任务在模拟 22 项服务的动态世界中运行数周。评测发现七个前沿模型得分均低,凸显当前智能体与真实生活辅助之间的差距。全部任务、环境与评测框架将开源。
Cultivar 是 FLORES 的本地化子集,用于评估模型在不同文化语境下的翻译表现,并与非本地化版本对比以探测数据污染和本地化鲁棒性。研究评测了 32 个开源权重模型,发现机器翻译专用模型鲁棒性较差,部分模型可能对 FLORES 过拟合,且模型普遍更擅长翻译美国内容而非其他地区内容。
Sci-VBench 基准包含 1,253 个专家标注示例,覆盖自然科学、医疗健康、人文社科与工程四大领域的 60 个主题,要求模型生成具备科学推理能力的时序视频。评测显示,16 个前沿模型在感知质量上接近,但在提示词接地性与科学因果正确性上差异显著,专有与开源模型间存在明显差距。
针对现有编码基准快速饱和及评测质量问题,研究团队推出 SWE-Bench ProMax,一个包含 170 个实例、覆盖七种编程语言(Python、Java、TypeScript、Go、C、C++、Rust)的多语言代码重构基准。
ENTLORE 是一个图基基准构建框架,从常规文档、组织表和运营记录中重建可审计的企业世界,用于测试模型从语料库中恢复隐含组织关系的能力。该基准包含 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合与潜在组织推理,已在 56 种模型与访问配置上评估。
DAIR.AI 发布本周(8月3日至9日)Top AI 论文。首篇提出智能体评估失败分类法,将41种失败模式归因于模型、工具、环境等组件,最强评判器 Cohen's kappa 达0.76。
研究者推出 Business Arena,一个让 AI 智能体长期经营跨境店铺的受控环境,数据基于真实 Alibaba.com 采购信息与权威市场条件校准。对 15 个前沿模型的评测显示,最终净资产均值相差九倍,即便最佳模型也落后于人类设计的策略,表明商业运营对 LLM 智能体仍具挑战。
A^2E(Agent Auditing Engine)是一个端到端智能体框架评测引擎,基于新提出的 Agent Task Protocol(ATP)快速集成不同框架的评测任务,并通过自动插桩的 Monitor 捕获标准化执行轨迹。
论文提出SA-PPG分层逐题概率差距评估法,通过采样估计每题求解概率并与干净模型逐题对比,揭示现有G-AP指标存在缺陷,导致此前污染缓解策略的恢复效果被显著高估。研究还提出RailCap缓解策略,在生成中限制回落到贪心轨迹的下一token为次优选项,在多个受污染模型和基准上取得最低SA-PPG。
一项新研究系统评测了大模型智能体(PC-Agents)在经历 11 个重大生活事件后的人格特质变化,以大五人格为锚点对照人类心理学纵向数据。结果显示,智能体在有无人类变化方向记录的事件-特质对上表现出相近的偏移率,偏移幅度普遍低于人类效应量,人格离散度较人类样本压缩 3-4 倍。研究推出可复用基准 BFI-Adapt 用于评分事件诱发人格变化的方向保真度,并据此对 14 个模型进行排名。
一项研究分析了60个语言模型基准测试的饱和度,发现近半数基准已出现饱和,且饱和率随基准年龄增长而上升。研究还发现,基准对饱和的抵抗力受专家策划影响,而非公开测试数据。结果表明,设计选择可延长基准寿命,并为更持久的评估方法提供参考。
Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$251 重写了约 16,000 行 Go 代码的生物信息学工具 gotree,而人类工程师预计需 2–17 周。该基准单次运行最高花费 $2,600,AI 连续工作 19 天,目前 22/25 个目标程序已开源。
谷歌新论文指出,金融深度研究智能体在重建过去方面远优于预测未来。在17个基线与FinanceHarness上,所有模型在400道专家标注问题上的总体得分均低于40%。使用相同Qwen3.6-27B骨干,从简单搜索循环升级到完整金融工具栈后,总分从25.3%提升至32.4%,而GRPO额外训练仅增加0.4个百分点,表明主要瓶颈在于因果与情景推理能力。
SWE-Touch 是一个通过“反向编辑”压力测试编码智能体在共享工作区中应对用户代码修改能力的框架。在 SWE-bench Verified 上,反向编辑使九款编码模型的平均解决率下降 7.7 个百分点,在更长任务基准上退化同样存在。轨迹分析显示,失败源于智能体对动态工作区感知不足,难以协调冲突编辑并验证修改后代码。
研究团队提出 WorldExam,一个分层诊断基准,覆盖视觉质量、控制遵循、空间一致性和世界反应性四个层级,含 1,474 个测试用例和八项任务,支持相机、动作和语言三种驱动范式的统一评测。对 20 个代表性模型的评估显示,没有任何模型能同时兼顾广泛任务覆盖与稳定性能,高视觉质量和显式指令遵循并不保证内在反应性。
ScrambleToolBench 是一个交互式终端基准,通过去除语义线索并引入映射漂移、随机动作失败和时间执行窗口等动态挑战,隔离智能体的行为推理能力。对前沿语言模型的评估显示,初始发现成功并不等于稳健适应:面对结构变化时,智能体无法使用循环追踪等演绎策略,转而表现出信念惯性或退化为穷举搜索。
GDPevo 是一个面向企业工作流的进化原生基准,通过规则杂交机制将工作流分解为原子业务规则并分配到训练与留出测试任务中,确保测试收益可归因于训练经验。V1 含 12 组 120 个任务,覆盖 CRM、ERP、金融、医疗、法律和数据中心工作流,全自动流水线可在两天内扩展至 V2 的 240 个任务。
The models are improving the models. Locus, our automated AI research system, is SOTA on PostTrainBench and post-trains ...