StartupBench:面向市场验证端到端工作流的通用智能体基准测试

HuggingFace Daily Papers(社区热门论文)·2026-08-18 08:00·1天前
AI 导读

StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

StartupBench:面向市场验证端到端工作流的通用智能体基准测试

2026-08-18 08:00· 1天前
AI 导读

StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

推荐理由

不同于基于研究者自选任务的基准,StartupBench 从有真实用户的产品工作流提炼任务,给出的约 30% 完成率将团队评估焦点从榜单得分拉回到端到端交付。

正文 · AI 翻译

大语言模型(LLM)与智能体的最新进展,已大幅提升了 AI 系统执行复杂任务的能力。然而,现有评测基准大多依赖研究者自行挑选的任务,因此尚不确定这些进展能否延伸到真实用户实际要求 AI 系统完成的工作上。我们推出了 StartupBench——一个以市场验证过的 AI 初创产品为基础的端到端智能体评测基准。我们并非基于对“有用智能体能力”的事先假设来定义任务,而是系统性地研究那些已被证明获得实际采用率的 AI 产品,连同其产品工作流与用户群体,从而识别出 AI 在多个专业领域已具备切实需求的实际任务。我们将这些工作流转化为以交付物为导向的完整任务,并用细粒度评分细则来捕捉其复杂要求。在统一智能体框架下对代表性模型进行评估后发现,即便最强的模型在 StartupBench 上也仅能成功完成约 30% 的任务,尽管在许多任务上已取得可观的阶段性进展。进一步分析表明,复杂指令遵循与领域专业知识等方面是主要的失败来源。我们的结果表明,许多经过市场验证的工作流仍超出当前通用智能体的可靠能力范围,这也使 StartupBench 成为衡量向端到端完成真实用户任务迈进程度的实证标尺。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org