普林斯顿大学的研究人员开发了 CEO-Bench 测试,要求 AI 智能体在模拟环境中运营一家虚构的软件公司,为期 500 天。目前大多数模型都会破产,而一个不依赖 AI 的简单规则启发式方法几乎能击败所有模型。
AI 智能体在狭窄任务上越来越擅长:修复漏洞、在对话中遵循服务策略、或完成基于网页的工作流程。普林斯顿大学的研究指出,这些任务具有简单的结构:智能体获得明确目标,采取简短行动,并迅速收到反馈。然而,许多重要的现实任务与此截然不同。它们涉及在不确定性下进行长期决策链,需要设定优先级、分配有限资源、解读嘈杂信号,并适应不断变化的条件。
为了精确测试这些能力,研究人员开发了 CEO-Bench。该基准测试模拟了这类长期任务的一个现实案例:在模拟环境中运营一家初创公司 500 天。
研究人员引用了一个著名案例:1997 年,苹果公司距离破产仅剩 90 天。史蒂夫·乔布斯画了一个简单的 2x2 矩阵——消费级与专业级、台式机与便携设备——并决定苹果只在这四个象限内打造产品。随后诞生了 iMac、iPod 和 iPhone。
作者认为,这种战略引导智能与当今 AI 智能体的能力有着本质区别。智能体在单项任务上进步迅速,但引导整个组织实现长期目标?这完全是另一个问题。CEO-Bench 正是衡量这种"引导智能"的首次尝试。
一家虚构软件公司的 AI 首席执行官
在 CEO-Bench 中,智能体运营一家名为 NovaMind 的虚构订阅制软件公司。公司初始拥有零客户和一百万美元现金。最终绩效以剩余现金衡量。一旦余额低于零,公司即宣告破产,模拟立即结束。
该智能体通过一个包含 34 个工具和 19 张表数据库的 Python API 来控制这家公司。它不只是发出单个指令,而是自己编写代码、用 SQL 查询数据库,并根据结果构建自定义工作流。研究人员表示,这使得它面临着与人类 CEO 相同的挑战。

需要决策的内容很多:定价与层级、各渠道广告支出、产品质量与研发、基础设施容量与客户支持,以及与企业客户的多轮谈判。除此之外,还有一个模拟的社交网络,智能体可以在其中阅读投诉、竞争对手新闻和经济趋势,并自行发帖。
延迟反馈与隐藏变量使测试变得困难
这项任务的难点在于时间和不确定性。决策会按照真实的商业时间线展开:收入只在账单日到账,研发项目需要数天到数周时间,而错误往往要等到后来通过用户流失或声誉受损才会显现。成本则是即时产生的。智能体必须花钱,而其回报可能数周后才显现。
公司的许多状态是隐藏的。智能体无法直接看到客户满意度、支付意愿或最低质量期望。它必须从取消订阅、支持工单或社交网络上的反应等带有噪声的信号中拼凑出这些信息。该模拟模型包含 26 个客户细分群体和单个客户,每个都有各自的预算、价格敏感度和期望。
世界也在不断变化。竞争对手会定期提高客户的质量期望,偏好会随时间推移而改变,模拟的商业周期也会影响需求和支付意愿,因此智能体必须持续调整。
研究人员特意选择了固定、透明的规则,而非语言模型作为裁判。他们希望避免在 Vending-Bench(一项使用模拟自动售货机的测试)中看到的缺陷:在该测试中,AI 模拟的供应商可能会因不切实际的口头承诺而奖励智能体。
大多数模型破产
在测试的十四个模型中,大多数未能完成任务。几乎所有模型都能生成有效的命令和数据库查询,但没有一个能长期维持连贯的策略。许多模型在模拟结束前就破产了。
只有三个模型在其最佳运行轮次结束时,资金高于起始的一百万美元:Claude Fable 5 达到 4715 万美元,Claude Opus 4.8 达到 2780 万美元,GPT-5.5 达到 2130 万美元。Claude Fable 5 是唯一一个在不止一轮运行中资金高于起始水平的模型。
不过,这里有一个注意事项。Fable 5 有一轮运行因模型拒绝继续而中止,而在另外两轮中,部分请求回退到了 Opus 4.8。GPT-5.5 在三轮运行中有两轮破产。

最具说服力的对比是与一个简单的、基于规则的启发式方法进行的,该方法完全不调用语言模型。它设定固定的价格、配额和等级,将广告和定向开发集中在少数客户群体上,并根据近期使用情况调整产能。该启发式方法达到了 1576 万美元,超过了除 Fable 5、Opus 4.8 和 GPT-5.5 之外的所有模型。
研究人员还粗略估计,最终现金余额的理论上限约为 22 亿美元。即使是最优秀的智能体也远未达到这一水平。作者表示,这项测试远未被充分利用。
探索胜过谨慎
分析决策轨迹揭示了清晰的行为差异。GPT-5.5 和 Claude Opus 4.8 会随着条件变化不断尝试新策略,无论是加大客户获取力度、调整定价层级,还是改变支持与研发预算。相比之下,Claude Opus 4.7 面对挫折时主要采取削减成本、保留现金的方式。这种被动策略虽能让模型存活到最后,却无法实现盈利。
有趣的是,Opus 4.8 和 GPT-5.5 通过截然不同的路径达到了相似的最终结果:Opus 4.8 在早期获取了更多客户,但在模拟中期客户数降为零;而 GPT-5.5 则在整个过程中保持了客户基础。两者都编写了出奇复杂的代码。Opus 4.8 构建了内部模拟系统,对客户群进行建模以预测未来现金流。GPT-5.5 则深入挖掘数据库中的谈判历史,以发现隐藏的客户偏好。
研究人员衡量了与成功相关的四种能力:
- 发现隐藏信息,例如哪个广告渠道对特定客户群体效果最佳;
- 预测未来,通过四周现金流预测的误差来衡量;
- 快速适应变化,通过模型察觉竞争对手动向的速度来衡量;
- 以及提前规划,部分通过智能体笔记中“如果-那么”场景出现的频率来衡量。
在这四项指标上,Opus 4.8 和 GPT-5.5 的得分均高于其他模型的平均水平。
工具环境也很重要
另一项发现涉及智能体用于行动所依赖的软件环境。研究人员还测试了使用 Claude Code 的 Claude Opus 4.7 和使用 Codex 的 GPT-5.5,这是两款流行的编程助手。在这两种情况下,智能体的行动频率都大幅降低,表现也更差。研究人员推测,原因是这些工具中针对软件开发优化的系统提示词。
缩短时间跨度也无法解决问题。当模拟压缩到 50 天时,只有 GPT-5.5 最终实现了盈利。研究人员得出结论,大多数模型即使在短期目标下,协调决策的能力仍然薄弱。
作者承认其研究设置存在局限性。产品仅通过单一质量评分来呈现,因为他们发现没有可靠的方法来评估产品在定性层面的变化。合规、安全和融资等方面被排除在外,以确保每次运行在经济上可行。尽管如此,他们表示,CEO-Bench 揭示了当前模型在本地工具使用能力与将长期行动串联成连贯策略的能力之间存在的差距。