LangChain 在 145 个智能体任务上评测了 NVIDIA NeMo Switchyard,结果显示仅 7% 的交互轮次需要前沿模型。通过路由策略,成本降低 74%,同时准确率仅下降 6 个百分点。
LangChain 在 145 个智能体任务上评测了 NVIDIA NeMo Switchyard,结果显示仅 7% 的交互轮次需要前沿模型。通过路由策略,成本降低 74%,同时准确率仅下降 6 个百分点。
Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。
腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass³也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。
LangChain 构建了 ReviewBench,一个用于评测代码审查智能体的基准,其评估依据来自可信审查者对真实 PR 的反馈。该基准旨在衡量智能体在代码审查任务中的表现,为开发者提供更贴近实际场景的评测标准。
Google 宣布 Gemini Enterprise Agent Platform 的评测服务正式全面可用(GA),为开发者提供统一引擎,可在本地开发实验和线上生产流量中一致地衡量智能体质量。
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
OpenRouter 发布 Ori Eval,一个能扫描代码库、自动编写 eval 文件并运行评测的智能体,帮助开发者在 500 多款模型中选出最适合自己项目的单一模型。
LangSmith 发布新功能 Align Evals,帮助用户校准 LLM 评估器,使其更贴合人类偏好。该功能旨在简化评估流程,减少人工标注与自动评估之间的偏差,提升评估结果的可信度。
OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。
Apple 机器学习研究团队提出 GH-ESD(Grounded Hypothesis-Driven Error Slice Discovery),一种针对目标检测与分割等实例级视觉任务的错误切片发现方法。现有方法主要适用于图像级分类,难以捕捉由上下文关系和空间视觉模式导致的实例级失败。GH-ESD 通过基于假设的驱动方式,系统性地发现模型在语义连贯子集上的系统性失效。
Google Cloud 数据库现已支持 Gemini 3.6 Flash,该模型知识截止日期约为今年 3 月底,且成本更低。在 Cloud SQL for Postgres 的基准测试中,Gemini 3.6 Flash 平均延迟 3694.53ms,快于 Gemini 3.5 Flash 的 4918.86ms;在 AlloyDB 中两者响应时间几乎相同。
美团 LongCat 团队开源 LoHoSearch,一个基于知识图谱自动生成题目的搜索智能体评测基准。该基准以 762 万维基百科实体构建知识图谱,生成 544 道经人工核验的题目,覆盖 11 个领域。当前最强模型 GPT-5.5 准确率仅 34.74%,远低于其在 BrowseComp 上的表现,表明 LoHoSearch 对长程搜索构成实质挑战。
同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
另有 1 家信源报道公众号:龙猫LongCat(美团)LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。该评测方案用于指导 Deep Agents 的版本迭代与变更发布。
Databricks 推出的前沿数据智能体在质量与成本上均优于通用编码智能体。该智能体通过专用数据工具链和领域优化,在复杂数据任务中实现了更高效率与更低开销。
蚂蚁 inclusionAI 开源自管多模型深度研究系统 PanelWise,多个研究 agent 独立检索撰写后经分析与合成生成最终结果。在 100 任务历史实验中,前沿组合得 73.68,超过当时记录的 OpenRouter Fusion 68.3;budget 组合得 66.42,成本约 $1.31/题,约为外部估计 $7/题的 19%。
LangChain 的 Eval Engineering Skill 能检查智能体的仓库代码与运行追踪,通过用户访谈提出评测方案,并输出可执行的 Harbor 任务。该技能旨在简化 AI 智能体评测的构建流程。
LangChain 构建了合成基准 IssueBench,用于评估 LangSmith Engine 在智能体轨迹中识别、分类和分组问题的能力。该基准通过模拟真实场景,测试引擎对 Agent 运行过程中各类异常的检测与归因效果。
乐天AI业务总经理Yusuke Kaji测试Claude Fable 5后表示,该模型能自主运行更长时间,首次实现夜间无人值守完成复杂任务。与之前模型不同,Fable 5在运行中持续自我验证和纠错,避免早期错误假设导致整次运行失败。乐天已在一周内将Claude Managed Agents部署到产品、销售、市场和财务等部门,各领域问题解决速度提升约10倍。
Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
xAI 发布 Grok 4.5 官方模型卡,详细记录了该模型的能力基准测试与安全评估结果。文档涵盖多项性能指标与安全评测数据,为开发者提供模型能力参考。
GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,token 效率处于领先水平,同时支持在超过20种模型间灵活选择。
OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。
另有 2 家信源报道X:OpenAI (@OpenAI)The Decoder:AI News(RSS)一项评估显示,GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,同时具备领先的 token 效率,并保持灵活选择超过 20 个模型的能力。该 harness 可跨不同模型和任务进行部署,兼顾性能与效率。
在5个模型上测试了1730道视觉推理题,发现将图像细节降至"low"会损失准确率,且在gpt-5.5上费用反而上升。真正可靠降低成本的手段是调节推理努力(reasoning effort)。
字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。
另有 1 家信源报道字节 Seed:Research Feed(网页内嵌数据)蚂蚁集团推出 Alipay-PIBench,一个用于评估 AI 编程智能体在真实支付集成任务中表现的仓库级基准。该基准涵盖 9 个产品级项目和 18 个任务实例,分为基础(功能支付完成)和高级(风险感知支付加固)两类场景,通过基于评分规则的评估方法衡量功能正确性、可靠性、安全性和业务状态一致性。在启用技能条件下,智能体的平均评分通过率(RPR)介于 68.58% 至 91.37% 之间。
OpenAI 推出 GeneBench-Pro 生物医学基准测试,包含 10 个案例研究。每个案例提供原始提示词、数据集和支持材料,覆盖体细胞肿瘤学(结构变异指导的肿瘤治疗获益-风险决策)、功能基因组学(CRISPR 靶点验证:lncRNA 转录本或基因组位点)和统计遗传学(连锁遗传位点中蛋白质药物靶点优先排序)等方向,要求模型输出 JSON 格式分析结果。
LangChain 与 Harbor 联合推出面向长时间运行、有状态 AI 智能体的统一评估栈。该方案整合了 Deep Agents 运行器、LangSmith 沙盒与可观测性工具,支持对复杂智能体行为进行端到端测试与调试。
LangChain 通过基准测试探究了单 ReAct 智能体在指令和工具数量增加时的性能变化,测试了 claude-3.5-sonnet、gpt-4o、o1 和 o3-mini 等模型在两个任务域上的表现。结果显示,指令和工具数量的增长会显著影响智能体的准确率和效率,不同模型对复杂度的容忍度存在差异。该研究为设计更高效的 Agent 系统提供了量化参考。
LangChain 推出包含 4 个测试环境的 Agent 工具使用基准,用于评估 LLM 在函数调用、规划和推理任务上的表现。该基准对比了 GPT-4、Claude 及多个开源模型。
LangChain 发布了一项针对聊天日志结构化数据提取的基准测试,对比了 GPT-4、Claude 与开源大语言模型的表现。该基准包含评估指标与数据集创建方法,旨在衡量不同模型从非结构化对话中提取结构化信息的能力。
一批来自中美新玩家的开放权重模型已发布。截至2026年6月,有四个最值得关注的开放权重模型,并给出了各自的最佳使用场景。
美团 LongCat 团队推出 VitaBench 2.0,首个真实生活场景下针对长期动态用户建模的智能体评测基准。包含56名拟真用户、819个复杂任务、超2000个动态偏好及66个可执行工具,每位用户平均2093个交互事件,时间跨度平均1580天。同时支持长文本上下文学习和智能体记忆策略评测。测试显示,最强模型 Claude-Opus-4.6 在“开卷”模式下平均分刚过0.5;开启思考模式并不总能提升个性化任务表现;所有模型在需要主动提问的任务上得分断崖式下跌。VitaBench 2.0 已开源。
GitHub Copilot agentic harness 在多个基准测试中表现强劲,同时具备领先的 token 效率,并支持在 20 多个模型间灵活选择。
美团 LongCat 团队开源 VitaBench 2.0,这是首个真实生活场景下面向长期动态用户建模的智能体评测基准,包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具,平均每位用户交互事件达2093个、时间跨度1580天。