返回
精选AI 评分 70/100

CRUX 项目提出"开放世界评估"测试前沿AI能力

AI as Normal Technology(RSS)·2026-04-17 01:47·135天前·Sayash Kapoor
AI 导读

CRUX项目由17位研究者组成,通过“开放世界评估”在真实场景中测试AI能力。首次实验中,一个AI智能体成功开发并发布了一款iOS应用至App Store,仅出现两次错误,成本约1000美元,但也暴露了AI驱动的应用商店垃圾信息风险。

AI as Normal Technology(RSS)
精选
70AI 编辑部评分,满分 100

CRUX 项目提出"开放世界评估"测试前沿AI能力

2026-04-17 01:47· 135天前· Sayash Kapoor
AI 导读

CRUX项目由17位研究者组成,通过“开放世界评估”在真实场景中测试AI能力。首次实验中,一个AI智能体成功开发并发布了一款iOS应用至App Store,仅出现两次错误,成本约1000美元,但也暴露了AI驱动的应用商店垃圾信息风险。

推荐理由

这篇提出「开放世界评估」概念,用发布 iOS 应用的实验证明 agent 已接近自主完成端到端真实任务,这给评估方法论和 App Store 反垃圾都敲了警钟。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:AI as Normal Technology(RSS)· normaltech.ai