# Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

- 来源：Google AI：DEV 作者专属（RSS）
- 作者：Jan-Felix Schmakeit
- 发布时间：2026-09-03 00:35
- AIHOT 分数：65
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmtkbz92801nmrowy61g2fsob
- 原文链接：https://dev.to/googleai/how-to-write-reliable-rubrics-for-llm-as-a-judge-evaluations-ndp

## 精选理由

作者来自 Google 团队，把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则，附带校准流程，适合自己搭建评测时参考。

## AI 摘要

Google AI 团队发布教程，讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准，指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验：问题保持原子化且互不重叠、只让评判模型评估客观事实（可用 RFC 2119 术语如 MUST 表述）、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
