计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器和人工标注员都无法大规模提供此类验证,因此该领域越来越倾向于使用视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期以来未被审视:这些 VLM 评判者是否足够可靠?为了系统性地研究这一问题,我们推出了 OSReward,这是一个真实、高质量的基准,用于评估 VLM 评判者在 CUA 轨迹上的表现。这些轨迹来自多种智能体主干,它们在不同平台上执行经过人工验证的指令,随后通过多阶段人工标注,以严格的地面真值判定进行标记。在此基础上,我们衍生出 OSReward-Hard(一个聚焦真正困难案例的挑战集)和 OSReward-Multi(用于细粒度的效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即便是最先进的模型也达不到理想评判者的标准,它们普遍存在一种宽松偏差,会将失败的运行误判为成功。少数足够可靠的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹评判开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,它们能提供低成本、稳定且可靠的奖励信号,以比前沿模型低 30-60% 的成本达到商业评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器和人工标注员都无法大规模提供此类验证,因此该领域越来越倾向于使用视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期以来未被审视:这些 VLM 评判者是否足够可靠?为了系统性地研究这一问题,我们推出了 OSReward,这是一个真实、高质量的基准,用于评估 VLM 评判者在 CUA 轨迹上的表现。这些轨迹来自多种智能体主干,它们在不同平台上执行经过人工验证的指令,随后通过多阶段人工标注,以严格的地面真值判定进行标记。在此基础上,我们衍生出 OSReward-Hard(一个聚焦真正困难案例的挑战集)和 OSReward-Multi(用于细粒度的效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即便是最先进的模型也达不到理想评判者的标准,它们普遍存在一种宽松偏差,会将失败的运行误判为成功。少数足够可靠的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹评判开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,它们能提供低成本、稳定且可靠的奖励信号,以比前沿模型低 30-60% 的成本达到商业评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org