按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)CRUX 项目提出"开放世界评估"测试前沿AI能力
AI 导读
CRUX项目由17位研究者组成,通过“开放世界评估”在真实场景中测试AI能力。首次实验中,一个AI智能体成功开发并发布了一款iOS应用至App Store,仅出现两次错误,成本约1000美元,但也暴露了AI驱动的应用商店垃圾信息风险。
AI as Normal Technology(RSS)
精选
70
AI 编辑部评分,满分 100CRUX 项目提出"开放世界评估"测试前沿AI能力
CRUX项目由17位研究者组成,通过“开放世界评估”在真实场景中测试AI能力。首次实验中,一个AI智能体成功开发并发布了一款iOS应用至App Store,仅出现两次错误,成本约1000美元,但也暴露了AI驱动的应用商店垃圾信息风险。
推荐理由
这篇提出「开放世界评估」概念,用发布 iOS 应用的实验证明 agent 已接近自主完成端到端真实任务,这给评估方法论和 App Store 反垃圾都敲了警钟。
来源:AI as Normal Technology(RSS)· normaltech.ai