# OSReward：为跨平台计算机操作智能体奖励模型建立标准化评测

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-30 08:00
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsij73nw1gobronkqj5jw9mj
- 原文链接：https://arxiv.org/abs/2607.28609

## 精选理由

该项基准比较了VLM法官在计算机使用轨迹上的可靠性，揭示其系统性宽大偏误；同时开源的OS-Shepherd奖励模型以更低成本提供与商业模型相当的评估信号，影响智能体训练的反馈设计。

## AI 摘要

OSReward 是一个用于评估视觉语言模型（VLM）作为计算机操作智能体（CUA）轨迹评判者的高质量基准，并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。

## 正文

计算机使用智能体（CUA）正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令，是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器和人工标注员都无法大规模提供此类验证，因此该领域越来越倾向于使用视觉语言模型（VLM）作为 CUA 轨迹的评判者。但一个根本性问题长期以来未被审视：这些 VLM 评判者是否足够可靠？为了系统性地研究这一问题，我们推出了 OSReward，这是一个真实、高质量的基准，用于评估 VLM 评判者在 CUA 轨迹上的表现。这些轨迹来自多种智能体主干，它们在不同平台上执行经过人工验证的指令，随后通过多阶段人工标注，以严格的地面真值判定进行标记。在此基础上，我们衍生出 OSReward-Hard（一个聚焦真正困难案例的挑战集）和 OSReward-Multi（用于细粒度的效率和一致性评分）。迄今为止最全面的 VLM 评判者评估发现，即便是最先进的模型也达不到理想评判者的标准，它们普遍存在一种宽松偏差，会将失败的运行误判为成功。少数足够可靠的模型又因成本过高而无法大规模运行，而价格可承受的开源模型则远远落后。为了弥合这一差距，我们构建并发布了 OS-Shepherd-100K，这是一个面向 CUA 社区的、带有推理标注的轨迹评判开放语料库。在此基础上，我们训练了 OS-Shepherd（9B 和 35B）开放奖励模型，它们能提供低成本、稳定且可靠的奖励信号，以比前沿模型低 30-60% 的成本达到商业评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
