HuggingFace Daily Papers(社区热门论文)
精选
71AI 编辑部评分,满分 100

OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测

2026-07-30 08:00· 8天前
AI 导读

OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。

推荐理由

该项基准比较了VLM法官在计算机使用轨迹上的可靠性,揭示其系统性宽大偏误;同时开源的OS-Shepherd奖励模型以更低成本提供与商业模型相当的评估信号,影响智能体训练的反馈设计。

正文 · AI 翻译

计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器和人工标注员都无法大规模提供此类验证,因此该领域越来越倾向于使用视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期以来未被审视:这些 VLM 评判者是否足够可靠?为了系统性地研究这一问题,我们推出了 OSReward,这是一个真实、高质量的基准,用于评估 VLM 评判者在 CUA 轨迹上的表现。这些轨迹来自多种智能体主干,它们在不同平台上执行经过人工验证的指令,随后通过多阶段人工标注,以严格的地面真值判定进行标记。在此基础上,我们衍生出 OSReward-Hard(一个聚焦真正困难案例的挑战集)和 OSReward-Multi(用于细粒度的效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即便是最先进的模型也达不到理想评判者的标准,它们普遍存在一种宽松偏差,会将失败的运行误判为成功。少数足够可靠的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹评判开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,它们能提供低成本、稳定且可靠的奖励信号,以比前沿模型低 30-60% 的成本达到商业评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测

HuggingFace Daily Papers(社区热门论文)·2026-07-30 08:00·8天前
AI 导读

OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。

正文 · AI 翻译

计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器和人工标注员都无法大规模提供此类验证,因此该领域越来越倾向于使用视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期以来未被审视:这些 VLM 评判者是否足够可靠?为了系统性地研究这一问题,我们推出了 OSReward,这是一个真实、高质量的基准,用于评估 VLM 评判者在 CUA 轨迹上的表现。这些轨迹来自多种智能体主干,它们在不同平台上执行经过人工验证的指令,随后通过多阶段人工标注,以严格的地面真值判定进行标记。在此基础上,我们衍生出 OSReward-Hard(一个聚焦真正困难案例的挑战集)和 OSReward-Multi(用于细粒度的效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即便是最先进的模型也达不到理想评判者的标准,它们普遍存在一种宽松偏差,会将失败的运行误判为成功。少数足够可靠的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹评判开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,它们能提供低成本、稳定且可靠的奖励信号,以比前沿模型低 30-60% 的成本达到商业评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org