HuggingFace Daily Papers(社区热门论文)
精选
82AI 编辑部评分,满分 100

OSWorld2.0:长时域真实世界计算机使用工作流基准

2026-06-28 08:00· 50天前
AI 导读

OSWorld2.0 发布,包含108个长时域计算机使用工作流,覆盖日常与专业任务。每项任务用户中位数约1.6小时完成,Claude Opus 4.7(最大思考)平均需318次工具调用(OSWorld 1.0约30次)。基准聚焦流交互、动态环境、跨源推理、隐式状态推断、视觉空间精度等真实挑战。任务基于真实输入工件和状态化用户档案,附安全报告。500步二元完成指标下,Claude Opus 4.8(最大思考+批量调用)得分最高仅20.6%(部分54.8%);GPT-5.5更省token但约13%。结果表明当前智能体远未达专业级:瓶颈不在基本GUI控制或编码,而是丢失约束、错过中途信息、猜测而非询问、跳过验证,尤其依赖隐藏状态时最差。

推荐理由

第一个真正长周期、真实工作流的计算机使用基准,结果显示当前最先进的 agent 仍不及格,关键短板不在 GUI 操作而在状态跟踪和验证,做 agent 的人必须读。

正文 · AI 翻译

现有的计算机使用基准测试无法捕捉真实世界计算机使用的现实性、复杂性和长周期需求,限制了它们揭示前沿智能体局限性的能力。我们推出了 OSWorld 2.0,这是一个包含 108 个长周期计算机使用工作流的基准测试,涵盖日常和专业任务,旨在捕捉复杂且具有挑战性的真实世界现象。每个任务都代表一个真实的端到端工作流,人类用户完成其中位时间约为 1.6 小时,而使用 Claude Opus 4.7 并开启最大思考模式时,平均需要 318 次工具调用,相比之下 OSWorld 1.0 中约为 30 次。OSWorld 2.0 针对真实工作流中常见但以往基准测试中代表性不足的挑战性现象,涵盖了交互设计挑战(如流式交互和动态环境)以及智能体模式挑战(如跨来源推理、隐式状态推断和视觉空间精度)。任务基于真实的输入工件,并与真实的、有状态的用户画像数据进行交叉引用,同时包含单独的安全报告以审计安全敏感的执行过程。在我们主要的 500 步二值完成度指标下,Claude Opus 4.8 在开启最大思考模式和批量工具调用时表现最佳,但仅完成了 20.6% 的任务,部分得分为 54.8%;GPT-5.5 的 token 效率高得多,但得分停滞在 13% 左右。这些结果表明,当前智能体距离专业级别的计算机使用仍相去甚远:它们并非在基本的 GUI 控制或编码上出错,而是会丢失约束条件、错过任务中途到达的信息、猜测而非询问用户,并且跳过验证环节,在任务依赖于它们必须恢复的隐藏状态时最为挣扎。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

OSWorld2.0:长时域真实世界计算机使用工作流基准

HuggingFace Daily Papers(社区热门论文)·2026-06-28 08:00·50天前
AI 导读

OSWorld2.0 发布,包含108个长时域计算机使用工作流,覆盖日常与专业任务。每项任务用户中位数约1.6小时完成,Claude Opus 4.7(最大思考)平均需318次工具调用(OSWorld 1.0约30次)。基准聚焦流交互、动态环境、跨源推理、隐式状态推断、视觉空间精度等真实挑战。任务基于真实输入工件和状态化用户档案,附安全报告。500步二元完成指标下,Claude Opus 4.8(最大思考+批量调用)得分最高仅20.6%(部分54.8%);GPT-5.5更省token但约13%。结果表明当前智能体远未达专业级:瓶颈不在基本GUI控制或编码,而是丢失约束、错过中途信息、猜测而非询问、跳过验证,尤其依赖隐藏状态时最差。

正文 · AI 翻译

现有的计算机使用基准测试无法捕捉真实世界计算机使用的现实性、复杂性和长周期需求,限制了它们揭示前沿智能体局限性的能力。我们推出了 OSWorld 2.0,这是一个包含 108 个长周期计算机使用工作流的基准测试,涵盖日常和专业任务,旨在捕捉复杂且具有挑战性的真实世界现象。每个任务都代表一个真实的端到端工作流,人类用户完成其中位时间约为 1.6 小时,而使用 Claude Opus 4.7 并开启最大思考模式时,平均需要 318 次工具调用,相比之下 OSWorld 1.0 中约为 30 次。OSWorld 2.0 针对真实工作流中常见但以往基准测试中代表性不足的挑战性现象,涵盖了交互设计挑战(如流式交互和动态环境)以及智能体模式挑战(如跨来源推理、隐式状态推断和视觉空间精度)。任务基于真实的输入工件,并与真实的、有状态的用户画像数据进行交叉引用,同时包含单独的安全报告以审计安全敏感的执行过程。在我们主要的 500 步二值完成度指标下,Claude Opus 4.8 在开启最大思考模式和批量工具调用时表现最佳,但仅完成了 20.6% 的任务,部分得分为 54.8%;GPT-5.5 的 token 效率高得多,但得分停滞在 13% 左右。这些结果表明,当前智能体距离专业级别的计算机使用仍相去甚远:它们并非在基本的 GUI 控制或编码上出错,而是会丢失约束条件、错过任务中途到达的信息、猜测而非询问用户,并且跳过验证环节,在任务依赖于它们必须恢复的隐藏状态时最为挣扎。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org