Claude Fable 5 在 RLI 基准测试中达成 16.1% 自动化率,刷新纪录

IT之家(RSS)·2026-07-03 14:06·60天前
AI 导读

AI 安全中心(CAIS)于 7 月 1 日更新远程劳动指数(RLI),Claude Fable 5 模型自动化率达 16.1%,创下新高。此前最高为 Opus 4.6(基于 Claude Cowork 框架)的 4.17%。RLI 自 2025 年 10 月底上线时的 2.5% 起步,8 个月内跃升至 16.1%。测试涵盖 3D/CAD、平面设计、视频动画、音频制作等真实远程自由职业项目,由人工评审员对照人类专业标准评判。Fable 5 在珠宝设计、2D 动画广告、建筑平面图等项目上有所改善,但与人工产品仍有差距。

IT之家(RSS)
54AI 编辑部评分,满分 100

Claude Fable 5 在 RLI 基准测试中达成 16.1% 自动化率,刷新纪录

2026-07-03 14:06· 60天前
AI 导读

AI 安全中心(CAIS)于 7 月 1 日更新远程劳动指数(RLI),Claude Fable 5 模型自动化率达 16.1%,创下新高。此前最高为 Opus 4.6(基于 Claude Cowork 框架)的 4.17%。RLI 自 2025 年 10 月底上线时的 2.5% 起步,8 个月内跃升至 16.1%。测试涵盖 3D/CAD、平面设计、视频动画、音频制作等真实远程自由职业项目,由人工评审员对照人类专业标准评判。Fable 5 在珠宝设计、2D 动画广告、建筑平面图等项目上有所改善,但与人工产品仍有差距。

IT之家 7 月 3 日消息,AI 安全中心(CAIS)于 7 月 1 日更新远程劳动指数(RLI),指出 AI 远程劳动自动化率正在经历快速跃升,Claude Fable 5 模型自动化率达到 16.1%,刷新该基准测试纪录。

IT之家注:RLI 在评测方面严苛按照工业标准测试,主要衡量 AI 智能体完成真实远程自由职业项目,涵盖 3D 与 CAD、架构设计、平面设计、视频动画、音频制作、数据分析、网页应用等。

每个交付物均由人工评审员审查,对照人类专业人员制作的标准交付物评判,其中一项“自动化率”核心指标是计算在 AI 交付的产品中,达到或者超过人类专业人员交付物质量的比重。

在本次榜单之前,该测试最高得分为 4.17%,由 Opus 4.6(基于 Claude Cowork 框架)创造。在 RLI(2025 年 10 月底发布)上线短短 8 个月内,最初最高得分为 2.5%,Claude Fable 5 模型的得分达到了 16.1%。

在具体项目表现上,例如在珠宝设计项目中,Fable 5 的戒指设计在质量上显著优于此前 AI 模型,不过实际交付物和人工设计产品依然存在一定差距。

在 2D 动画广告、建筑平面图等项目上,新模型的视觉质量和模型准确度均有改善。

来源:IT之家(RSS)· ithome.com