STORY · 事件已收束

OSReward-Hard 基准发布

1 个精选信源 · 1 篇报道持续 1最新动态 8天前
最新进展

OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测
    HuggingFace Daily Papers(社区热门论文)精选

    OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。