# StartupBench：面向市场验证端到端工作流的通用智能体基准测试

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-18 08:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmszieman0euzrodptihyllom
- 原文链接：https://arxiv.org/abs/2608.17800

## 精选理由

不同于基于研究者自选任务的基准，StartupBench 从有真实用户的产品工作流提炼任务，给出的约 30% 完成率将团队评估焦点从榜单得分拉回到端到端交付。

## AI 摘要

StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准，从真实采用的产品工作流中提炼任务，而非研究者预设任务。在统一智能体框架下，最强模型也仅能完成约 30% 的任务，复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

## 正文

大语言模型（LLM）与智能体的最新进展，已大幅提升了 AI 系统执行复杂任务的能力。然而，现有评测基准大多依赖研究者自行挑选的任务，因此尚不确定这些进展能否延伸到真实用户实际要求 AI 系统完成的工作上。我们推出了 StartupBench——一个以市场验证过的 AI 初创产品为基础的端到端智能体评测基准。我们并非基于对“有用智能体能力”的事先假设来定义任务，而是系统性地研究那些已被证明获得实际采用率的 AI 产品，连同其产品工作流与用户群体，从而识别出 AI 在多个专业领域已具备切实需求的实际任务。我们将这些工作流转化为以交付物为导向的完整任务，并用细粒度评分细则来捕捉其复杂要求。在统一智能体框架下对代表性模型进行评估后发现，即便最强的模型在 StartupBench 上也仅能成功完成约 30% 的任务，尽管在许多任务上已取得可观的阶段性进展。进一步分析表明，复杂指令遵循与领域专业知识等方面是主要的失败来源。我们的结果表明，许多经过市场验证的工作流仍超出当前通用智能体的可靠能力范围，这也使 StartupBench 成为衡量向端到端完成真实用户任务迈进程度的实证标尺。
