# Agent评测漫谈：从打分动作走向基础设施能力

- 来源：公众号：龙猫LongCat（美团）
- 作者：龙猫LongCat
- 发布时间：2026-08-06 10:24
- AIHOT 分数：57
- AIHOT 链接：https://aihot.virxact.com/items/cmsgznqdb066froxzsgoxawik
- 原文链接：https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA%3D%3D&mid=2651783112&idx=1&sn=785b0bc4b98c0324a528cb87717f3032

## AI 摘要

美团图灵Agent评测团队公开内部博客，系统讲解Agent评测方法论。评测核心是回答“Agent好不好”，需覆盖结果、过程、效率、风险四层，并以观测为基石。团队提出“人人一致、人机一致”对齐法，通过指标下钻与Rubric二元化，使数字站长人机一致率达99%，Beam从62%提升至92%。文章还探讨了长程Agent（如Claude Code）对观测评测带来的演进。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
