内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 146 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「评测/基准」清除

8月11日周二

22:32LangChain:Blog(RSS)45NVIDIA NeMo Switchyard 评测:智能体调用中仅 7% 需要前沿模型

8月6日周四

22:31Databricks:Blog(RSS)46Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准
12:01公众号:龙猫LongCat(美团)57Agent评测漫谈:从打分动作走向基础设施能力

8月3日周一

20:35公众号:腾讯混元55E-Bench:以腾讯产品为原型的 AI 智能体大考

8月1日周六

01:26LangChain:Blog(RSS)50LangChain 推出 ReviewBench:用真实 PR 反馈评测代码审查智能体
00:42Google Developers Blog(RSS)54Gemini Enterprise Agent Platform 的 Agent 与模型评测服务正式 GA

7月31日周五

18:00公众号:小红书技术(dots.llm)78精选小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格
08:00OpenRouter:Announcements(RSS)75精选OpenRouter 推出 Ori Eval:用你的数据证明哪款模型最适合你的项目
07:26LangChain:Blog(RSS)58LangSmith 推出 Align Evals:校准 LLM 评估器以匹配人类偏好

7月30日周四

07:11OpenAI:官网动态(RSS · 排除企业/客户案例)68精选启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

7月27日周一

23:50Apple Machine Learning Research(RSS)40Apple 提出 GH-ESD:面向实例级视觉任务的假设驱动错误切片发现方法

7月26日周日

14:11Google AI:DEV 作者专属(RSS)68精选Gemini 3.6 Flash 登陆 Google Cloud 数据库:更快更便宜

7月24日周五

12:00公众号:龙猫LongCat(美团)58同事件美团 LongCat 开源 LoHoSearch:基于知识图谱的搜索智能体评测基准同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》
12:00公众号:龙猫LongCat(美团)68精选MineExplorer:首个《我的世界》分钟级长程任务评测基准发布
10:31LangChain:Blog(RSS)47LangChain 发布 Deep Agents 新基准评测方案

7月23日周四

23:33Databricks:Blog(RSS)30Databricks 前沿数据智能体在质量和成本上超越通用编码智能体
19:05蚂蚁 inclusionAI:GitHub 新仓库57精选蚂蚁 inclusionAI 开源多模型深度研究系统 PanelWise
15:36LangChain:Blog(RSS)48LangChain 推出 Eval Engineering Skill:基于仓库上下文与追踪自动生成评测任务

7月21日周二

02:36LangChain:Blog(RSS)40LangChain 发布 IssueBench:评估 LangSmith Engine 对智能体轨迹问题的识别与分类能力

7月20日周一

23:49Claude:Blog(网页)42乐天用 Claude Fable 5 构建可自主运行数小时的智能体

7月18日周六

00:32Claude:Blog(网页)64精选Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

7月17日周五

03:11Moonshot AI:Kimi Blog70精选Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

7月14日周二

08:00Cursor Blog41Grok 4.5 模型卡发布:基准测试与安全评估详情

7月9日周四

06:11GitHub Blog38GitHub Copilot agentic harness 跨模型与任务评测:多基准性能强劲、token 效率领先
04:08OpenAI:官网动态(RSS · 排除企业/客户案例)70精选OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷
00:11GitHub Blog41GitHub Copilot agentic harness 跨模型与任务基准测试:性能强劲、token 效率领先

7月8日周三

00:24OpenRouter:Announcements(RSS)65精选在LLM中选择最佳图像输入细节级别

7月7日周二

12:22字节 Seed:Research Papers(网页内嵌数据)74精选EdgeBench:从真实世界环境中揭示学习缩放定律

7月6日周一

16:13蚂蚁 inclusionAI:GitHub 新仓库57蚂蚁集团发布 Alipay-PIBench:面向支付集成的 AI 编程智能体评测基准

7月1日周三

01:03OpenAI:官网动态(RSS · 排除企业/客户案例)41OpenAI 发布 Genebench-Pro 基准测试:10个案例研究详解
00:38LangChain:Blog(RSS)56Harbor x LangChain:面向智能体评估的统一栈

6月30日周二

09:27LangChain:Blog(RSS)52LangChain 基准测试:指令与工具数量对单 ReAct 智能体性能的影响
09:27LangChain:Blog(RSS)5Benchmarking Query Analysis in High Cardinality Situations
09:27LangChain:Blog(RSS)40LangChain 发布 Agent 工具使用基准测试:对比 GPT-4、Claude 与开源模型
09:27LangChain:Blog(RSS)52LangChain 发布结构化数据提取基准:GPT-4、Claude 与开源 LLM 对比

6月27日周六

18:41OpenRouter:Announcements(RSS)502026年6月值得关注的开放权重模型

6月26日周五

12:00公众号:龙猫LongCat(美团)69精选美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
07:01GitHub Blog51跨模型与任务的 GitHub Copilot agentic harness 性能与效率评估
00:00METR:Blog(网页)8Summary of METR's predeployment evaluation of GPT-5.6 Sol

6月25日周四

19:58公众号:龙猫LongCat(美团)69精选美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「评测/基准」 · 146 条清除

8月11日

星期二 · 1 条
22:32
LangChain:Blog(RSS)
AI 评分 45/100
NVIDIA NeMo Switchyard 评测:智能体调用中仅 7% 需要前沿模型

LangChain 在 145 个智能体任务上评测了 NVIDIA NeMo Switchyard,结果显示仅 7% 的交互轮次需要前沿模型。通过路由策略,成本降低 74%,同时准确率仅下降 6 个百分点。

智能体评测/基准

8月6日

星期四 · 2 条
22:31
Databricks:Blog(RSS)
AI 评分 46/100
Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准

Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。

推理评测/基准
12:01
公众号:龙猫LongCat(美团)
AI 评分 57/100
Agent评测漫谈:从打分动作走向基础设施能力

美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。

智能体教程/实践评测/基准

8月3日

星期一 · 1 条
20:35
公众号:腾讯混元
AI 评分 55/100
E-Bench:以腾讯产品为原型的 AI 智能体大考

腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass³也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。

智能体arXiv论文/研究评测/基准

8月1日

星期六 · 2 条
01:26
LangChain:Blog(RSS)
AI 评分 50/100
LangChain 推出 ReviewBench:用真实 PR 反馈评测代码审查智能体

LangChain 构建了 ReviewBench,一个用于评测代码审查智能体的基准,其评估依据来自可信审查者对真实 PR 的反馈。该基准旨在衡量智能体在代码审查任务中的表现,为开发者提供更贴近实际场景的评测标准。

智能体编码评测/基准
00:42
Google Developers Blog(RSS)
AI 评分 54/100
Gemini Enterprise Agent Platform 的 Agent 与模型评测服务正式 GA

Google 宣布 Gemini Enterprise Agent Platform 的评测服务正式全面可用(GA),为开发者提供统一引擎,可在本地开发实验和线上生产流量中一致地衡量智能体质量。

智能体Google产品更新评测/基准

7月31日

星期五 · 3 条
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 78/100
小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格

小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。

智能体AnthropicOpenAI评测/基准

推荐理由:两份基准将「主动性」「持久化」等模糊期待变为可量化信号,让模型在真实生活中的表现第一次有了可比较的刻度,会影响产品设计中对助手能力的评估方式。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 75/100
OpenRouter 推出 Ori Eval:用你的数据证明哪款模型最适合你的项目

OpenRouter 发布 Ori Eval,一个能扫描代码库、自动编写 eval 文件并运行评测的智能体,帮助开发者在 500 多款模型中选出最适合自己项目的单一模型。

智能体产品更新评测/基准

推荐理由:Ori Eval 把评测集成到代码库并支持 CI,将模型比较变成可重复的工程实践,选型不再只靠 benchmark 或手感。
07:26
LangChain:Blog(RSS)
AI 评分 58/100
LangSmith 推出 Align Evals:校准 LLM 评估器以匹配人类偏好

LangSmith 发布新功能 Align Evals,帮助用户校准 LLM 评估器,使其更贴合人类偏好。该功能旨在简化评估流程,减少人工标注与自动评估之间的偏差,提升评估结果的可信度。

产品更新评测/基准

7月30日

星期四 · 1 条
07:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 68/100
启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。

OpenAI推理评测/基准

推荐理由:OpenAI 自己公布两个设置让 GPT-5.6 的 ARC-AGI-3 成绩翻三倍,对用 API 做推理任务的人是即用的技巧,不过目前只给了摘要,具体参数得等全文。

7月27日

星期一 · 1 条
23:50
Apple Machine Learning Research(RSS)
AI 评分 40/100
Apple 提出 GH-ESD:面向实例级视觉任务的假设驱动错误切片发现方法

Apple 机器学习研究团队提出 GH-ESD(Grounded Hypothesis-Driven Error Slice Discovery),一种针对目标检测与分割等实例级视觉任务的错误切片发现方法。现有方法主要适用于图像级分类,难以捕捉由上下文关系和空间视觉模式导致的实例级失败。GH-ESD 通过基于假设的驱动方式,系统性地发现模型在语义连贯子集上的系统性失效。

论文/研究评测/基准

7月26日

星期日 · 1 条
14:11
Google AI:DEV 作者专属(RSS)精选
AI 评分 68/100
Gemini 3.6 Flash 登陆 Google Cloud 数据库:更快更便宜

Google Cloud 数据库现已支持 Gemini 3.6 Flash,该模型知识截止日期约为今年 3 月底,且成本更低。在 Cloud SQL for Postgres 的基准测试中,Gemini 3.6 Flash 平均延迟 3694.53ms,快于 Gemini 3.5 Flash 的 4918.86ms;在 AlloyDB 中两者响应时间几乎相同。

Google评测/基准部署/工程

推荐理由:在Cloud SQL和AlloyDB环境中的实测表明,Gemini 3.5 Flash Lite以7倍速度与接近满分质量,为简单任务提供了更经济的选项,但样本量小且评判模型自带偏好,结论需谨慎采纳。

7月24日

星期五 · 3 条
12:00
公众号:龙猫LongCat(美团)同事件
AI 评分 58/100
美团 LongCat 开源 LoHoSearch:基于知识图谱的搜索智能体评测基准

美团 LongCat 团队开源 LoHoSearch,一个基于知识图谱自动生成题目的搜索智能体评测基准。该基准以 762 万维基百科实体构建知识图谱,生成 544 道经人工核验的题目,覆盖 11 个领域。当前最强模型 GPT-5.5 准确率仅 34.74%,远低于其在 BrowseComp 上的表现,表明 LoHoSearch 对长程搜索构成实质挑战。

arXiv开源生态搜索评测/基准
同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》
12:00
公众号:龙猫LongCat(美团)精选
AI 评分 68/100
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

arXiv具身智能多模态论文/研究
另有 1 家信源报道公众号:龙猫LongCat(美团)
推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。
10:31
LangChain:Blog(RSS)
AI 评分 47/100
LangChain 发布 Deep Agents 新基准评测方案

LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。该评测方案用于指导 Deep Agents 的版本迭代与变更发布。

智能体教程/实践评测/基准

7月23日

星期四 · 3 条
23:33
Databricks:Blog(RSS)
AI 评分 30/100
Databricks 前沿数据智能体在质量和成本上超越通用编码智能体

Databricks 推出的前沿数据智能体在质量与成本上均优于通用编码智能体。该智能体通过专用数据工具链和领域优化,在复杂数据任务中实现了更高效率与更低开销。

智能体数据/训练评测/基准
19:05
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 57/100
蚂蚁 inclusionAI 开源多模型深度研究系统 PanelWise

蚂蚁 inclusionAI 开源自管多模型深度研究系统 PanelWise,多个研究 agent 独立检索撰写后经分析与合成生成最终结果。在 100 任务历史实验中,前沿组合得 73.68,超过当时记录的 OpenRouter Fusion 68.3;budget 组合得 66.42,成本约 $1.31/题,约为外部估计 $7/题的 19%。

智能体开源/仓库评测/基准

推荐理由:其价值不在分数本身,而在公开了完整管线与实验中已知的协议差异,为复现和公平对比提供了可操作的起点。
15:36
LangChain:Blog(RSS)
AI 评分 48/100
LangChain 推出 Eval Engineering Skill:基于仓库上下文与追踪自动生成评测任务

LangChain 的 Eval Engineering Skill 能检查智能体的仓库代码与运行追踪,通过用户访谈提出评测方案,并输出可执行的 Harbor 任务。该技能旨在简化 AI 智能体评测的构建流程。

产品更新评测/基准

7月21日

星期二 · 1 条
02:36
LangChain:Blog(RSS)
AI 评分 40/100
LangChain 发布 IssueBench:评估 LangSmith Engine 对智能体轨迹问题的识别与分类能力

LangChain 构建了合成基准 IssueBench,用于评估 LangSmith Engine 在智能体轨迹中识别、分类和分组问题的能力。该基准通过模拟真实场景,测试引擎对 Agent 运行过程中各类异常的检测与归因效果。

智能体开源生态评测/基准

7月20日

星期一 · 1 条
23:49
Claude:Blog(网页)
AI 评分 42/100
乐天用 Claude Fable 5 构建可自主运行数小时的智能体

乐天AI业务总经理Yusuke Kaji测试Claude Fable 5后表示,该模型能自主运行更长时间,首次实现夜间无人值守完成复杂任务。与之前模型不同,Fable 5在运行中持续自我验证和纠错,避免早期错误假设导致整次运行失败。乐天已在一周内将Claude Managed Agents部署到产品、销售、市场和财务等部门,各领域问题解决速度提升约10倍。

智能体Anthropic评测/基准

7月18日

星期六 · 1 条
00:32
Claude:Blog(网页)精选
AI 评分 64/100
Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

智能体Anthropic编码评测/基准

推荐理由:Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。

7月17日

星期五 · 1 条
03:11
Moonshot AI:Kimi Blog精选
AI 评分 70/100
Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

多模态评测/基准

推荐理由:这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。

7月14日

星期二 · 1 条
08:00
Cursor Blog
AI 评分 41/100
Grok 4.5 模型卡发布:基准测试与安全评估详情

xAI 发布 Grok 4.5 官方模型卡,详细记录了该模型的能力基准测试与安全评估结果。文档涵盖多项性能指标与安全评测数据,为开发者提供模型能力参考。

xAI安全/对齐推理评测/基准

7月9日

星期四 · 3 条
06:11
GitHub Blog
AI 评分 38/100
GitHub Copilot agentic harness 跨模型与任务评测:多基准性能强劲、token 效率领先

GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,token 效率处于领先水平,同时支持在超过20种模型间灵活选择。

智能体GitHub评测/基准
04:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 70/100
OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。

OpenAI编码论文/研究评测/基准
另有 2 家信源报道X:OpenAI (@OpenAI)The Decoder:AI News(RSS)
推荐理由:OpenAI 自己审计了 SWE-Bench Pro,发现三成任务有缺陷,这个基准给出来的分数可能要打问号,做模型评测和选型的人该认真看看。
00:11
GitHub Blog
AI 评分 41/100
GitHub Copilot agentic harness 跨模型与任务基准测试:性能强劲、token 效率领先

一项评估显示,GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,同时具备领先的 token 效率,并保持灵活选择超过 20 个模型的能力。该 harness 可跨不同模型和任务进行部署,兼顾性能与效率。

GitHub编码评测/基准

7月8日

星期三 · 1 条
00:24
OpenRouter:Announcements(RSS)精选
AI 评分 65/100
在LLM中选择最佳图像输入细节级别

在5个模型上测试了1730道视觉推理题,发现将图像细节降至"low"会损失准确率,且在gpt-5.5上费用反而上升。真正可靠降低成本的手段是调节推理努力(reasoning effort)。

OpenAI多模态评测/基准

推荐理由:OpenRouter 用 1730 道题的实验告诉你,降图像细节未必省钱,GPT-5.5 上反而更贵,真正靠谱的开关是控制推理努力。做视觉应用的不看这个容易踩坑。

7月7日

星期二 · 1 条
12:22
字节 Seed:Research Papers(网页内嵌数据)精选
AI 评分 74/100
EdgeBench:从真实世界环境中揭示学习缩放定律

字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。

智能体arXiv论文/研究评测/基准
另有 1 家信源报道字节 Seed:Research Feed(网页内嵌数据)
推荐理由:这篇论文首次量化了智能体在134个长周期真实任务中从环境学习的性能曲线,发现log-sigmoid缩放定律精确度极高,且学习速度约每三个月翻倍。对于正在设计长期自主agent的团队,这是一份必须看的底层规律报告。

7月6日

星期一 · 1 条
16:13
蚂蚁 inclusionAI:GitHub 新仓库
AI 评分 57/100
蚂蚁集团发布 Alipay-PIBench:面向支付集成的 AI 编程智能体评测基准

蚂蚁集团推出 Alipay-PIBench,一个用于评估 AI 编程智能体在真实支付集成任务中表现的仓库级基准。该基准涵盖 9 个产品级项目和 18 个任务实例,分为基础(功能支付完成)和高级(风险感知支付加固)两类场景,通过基于评分规则的评估方法衡量功能正确性、可靠性、安全性和业务状态一致性。在启用技能条件下,智能体的平均评分通过率(RPR)介于 68.58% 至 91.37% 之间。

编码论文/研究评测/基准

7月1日

星期三 · 2 条
01:03
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 41/100
OpenAI 发布 Genebench-Pro 基准测试:10个案例研究详解

OpenAI 推出 GeneBench-Pro 生物医学基准测试,包含 10 个案例研究。每个案例提供原始提示词、数据集和支持材料,覆盖体细胞肿瘤学(结构变异指导的肿瘤治疗获益-风险决策)、功能基因组学(CRISPR 靶点验证:lncRNA 转录本或基因组位点)和统计遗传学(连锁遗传位点中蛋白质药物靶点优先排序)等方向,要求模型输出 JSON 格式分析结果。

OpenAI教程/实践评测/基准
00:38
LangChain:Blog(RSS)
AI 评分 56/100
Harbor x LangChain:面向智能体评估的统一栈

LangChain 与 Harbor 联合推出面向长时间运行、有状态 AI 智能体的统一评估栈。该方案整合了 Deep Agents 运行器、LangSmith 沙盒与可观测性工具,支持对复杂智能体行为进行端到端测试与调试。

智能体教程/实践评测/基准

6月30日

星期二 · 4 条
09:27
LangChain:Blog(RSS)
AI 评分 52/100
LangChain 基准测试:指令与工具数量对单 ReAct 智能体性能的影响

LangChain 通过基准测试探究了单 ReAct 智能体在指令和工具数量增加时的性能变化,测试了 claude-3.5-sonnet、gpt-4o、o1 和 o3-mini 等模型在两个任务域上的表现。结果显示,指令和工具数量的增长会显著影响智能体的准确率和效率,不同模型对复杂度的容忍度存在差异。该研究为设计更高效的 Agent 系统提供了量化参考。

智能体AnthropicOpenAI评测/基准
09:27
LangChain:Blog(RSS)
AI 评分 5/100
Benchmarking Query Analysis in High Cardinality Situations
搜索评测/基准
09:27
LangChain:Blog(RSS)
AI 评分 40/100
LangChain 发布 Agent 工具使用基准测试:对比 GPT-4、Claude 与开源模型

LangChain 推出包含 4 个测试环境的 Agent 工具使用基准,用于评估 LLM 在函数调用、规划和推理任务上的表现。该基准对比了 GPT-4、Claude 及多个开源模型。

智能体评测/基准
09:27
LangChain:Blog(RSS)
AI 评分 52/100
LangChain 发布结构化数据提取基准:GPT-4、Claude 与开源 LLM 对比

LangChain 发布了一项针对聊天日志结构化数据提取的基准测试,对比了 GPT-4、Claude 与开源大语言模型的表现。该基准包含评估指标与数据集创建方法,旨在衡量不同模型从非结构化对话中提取结构化信息的能力。

AnthropicOpenAI数据/训练评测/基准

6月27日

星期六 · 1 条
18:41
OpenRouter:Announcements(RSS)
AI 评分 50/100
2026年6月值得关注的开放权重模型

一批来自中美新玩家的开放权重模型已发布。截至2026年6月,有四个最值得关注的开放权重模型,并给出了各自的最佳使用场景。

开源生态评测/基准

6月26日

星期五 · 3 条
12:00
公众号:龙猫LongCat(美团)精选
AI 评分 69/100
美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

美团 LongCat 团队推出 VitaBench 2.0,首个真实生活场景下针对长期动态用户建模的智能体评测基准。包含56名拟真用户、819个复杂任务、超2000个动态偏好及66个可执行工具,每位用户平均2093个交互事件,时间跨度平均1580天。同时支持长文本上下文学习和智能体记忆策略评测。测试显示,最强模型 Claude-Opus-4.6 在“开卷”模式下平均分刚过0.5;开启思考模式并不总能提升个性化任务表现;所有模型在需要主动提问的任务上得分断崖式下跌。VitaBench 2.0 已开源。

智能体开源生态评测/基准

推荐理由:美团LongCat开源的VitaBench 2.0是首个评测AI长期理解用户偏好的基准,实验发现最强模型得分也刚过0.5,做Agent和推荐系统的值得跑一遍。
07:01
GitHub Blog
AI 评分 51/100
跨模型与任务的 GitHub Copilot agentic harness 性能与效率评估

GitHub Copilot agentic harness 在多个基准测试中表现强劲,同时具备领先的 token 效率,并支持在 20 多个模型间灵活选择。

GitHub编码评测/基准
00:00
METR:Blog(网页)
AI 评分 8/100
Summary of METR's predeployment evaluation of GPT-5.6 Sol
OpenAI模型发布评测/基准

6月25日

星期四 · 1 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 69/100
美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

美团 LongCat 团队开源 VitaBench 2.0,这是首个真实生活场景下面向长期动态用户建模的智能体评测基准,包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具,平均每位用户交互事件达2093个、时间跨度1580天。

智能体arXivHugging Face论文/研究

推荐理由:它将评测重心从单次任务转移到对用户偏好的长期追踪与主动沟通,实验显示主动提问和偏好利用仍是普遍短板,记忆策略并非简单叠加,这会改变智能体个性化研究的评估方法。
已加载 40 条