# CRUX 项目提出"开放世界评估"测试前沿AI能力

- 来源：AI as Normal Technology（RSS）
- 作者：Sayash Kapoor
- 发布时间：2026-04-17 01:47
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms3fv5il00ofrondzp68ytt6
- 原文链接：https://www.normaltech.ai/p/open-world-evaluations-for-measuring

## 精选理由

这篇提出「开放世界评估」概念，用发布 iOS 应用的实验证明 agent 已接近自主完成端到端真实任务，这给评估方法论和 App Store 反垃圾都敲了警钟。

## AI 摘要

CRUX项目由17位研究者组成，通过“开放世界评估”在真实场景中测试AI能力。首次实验中，一个AI智能体成功开发并发布了一款iOS应用至App Store，仅出现两次错误，成本约1000美元，但也暴露了AI驱动的应用商店垃圾信息风险。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
