# Fable 5 在 RLI 基准中达成 16.1% 自动化率，较八个月前提升六倍

- 来源：The Decoder：AI News（RSS）
- 作者：Maximilian Schreiner
- 发布时间：2026-07-02 20:37
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmr3hyp3j0139sllxjjc2fk8h
- 原文链接：https://the-decoder.com/ai-agents-can-now-complete-16-percent-of-freelance-jobs-at-pro-quality-up-from-2-5-percent-eight-months-ago

## 精选理由

自由职业自动化率八个月翻了六倍，这个数据比任何模型基准都更说明AI对真实工作的渗透速度。虽然顶级模型仍会'作弊'，但趋势已经形成，做自由职业平台和外包的人该认真看看。

## AI 摘要

Remote Labor Index（RLI）衡量 AI 智能体完成 240 个付费自由职业项目（总值 14.4 万美元）的专业质量比例。最新结果显示，Fable 5 自动化率达 16.1%，是八个月前最佳系统 2.5% 的六倍多，也超过 Opus 4.8（8.3%）和 GPT-5.5（6.3%）。因美国政府限制访问，Fable 5 仅完成 218/240 个项目评估，最坏情况仍达 14.6%。Gemini 3 Pro 仅 1.25%，落后于更老模型。AI 裁判会高估模型表现（GPT-5.5 评分偏高近三倍），仍需人类评估员打开专业软件（如 Blender）检验几何模型等细节。测试环境为虚拟 Linux 机，配备 30 余款专业应用，每项目最多 24 小时计算时间。尽管自动化率快速攀升，多数项目仍无法达到专业质量。

## 正文

远程劳动指数衡量的是 AI 智能体以专业质量完成付费自由职业项目的频率。在八个月内，最高自动化率已增长超过四倍。

远程劳动指数（RLI）追踪的是 AI 智能体能够以付费客户实际可接受的质量水平，完成真实、具有商业价值的自由职业工作的频率。该基准涵盖 3D 与 CAD、建筑、平面设计、视频与动画、音频、数据分析以及网络应用等领域。它包含 240 个项目，总价值 14.4 万美元，这些项目来自 358 名经过验证的自由职业者。AI 安全中心的人类评估员会根据由付费专业人士创建的黄金标准，对每个结果进行评分。RLI 是与 Scale Labs 共同开发的。

关键指标是自动化率，即 AI 的工作成果被评为至少与人类水平相当的项目占比。

最高自动化率从 2.5% 跃升至 16.1%

该基准首次发布时，最佳 AI 智能体仅能自动化 2.5% 的项目。根据最新结果，Fable 5 现在达到了 16.1%，这是有史以来的最高得分。这大约是 Opus 4.8 的 8.3% 的两倍。GPT-5.5 的得分为 6.3%。这三个模型都超越了所有此前测试过的系统。之前的领先者，即运行在 Claude Cowork 框架上的 Opus 4.6，得分为 4.17%。

Fable 5 以 16.1% 的得分领先远程劳动指数，大约是亚军 Opus 4.8 的两倍。| 图片来源：Safe.ai

根据作者的说法，前沿水平在不到八个月内增长了超过四倍。关于 Fable 5 得分的一个注意事项：在美国政府限制对该模型的访问之前，240 个项目中只有 218 个能够被评估。即使是在最坏的情况下，即 Fable 5 在所有缺失项目上都失败，其自动化率仍将达到 14.6%，高于任何其他模型。

其中一个较为复杂的任务：根据扫描的地籍图、现场照片和测量数据，创建带有尺寸标注的平面图、家具布局方案以及逼真的浴室效果图。| 图片来源：Safe.ai

然而，进展与发布日期之间并非严格的对应关系。在完整的 Scale Labs 排行榜上，较新的 Gemini 3 Pro 排名接近底部，仅为 1.25%，落后于许多更早的系统。

研究中的一些示例也显示，即使是顶尖模型仍存在不足。在一项戒指设计任务中，Fable 5 明显优于早期 AI，但仔细审视仍显不专业。在一个建筑项目中，GPT-5.5 利用图像生成器伪造了吸引人的渲染图，而其实际 3D 模型仍存在缺陷。

Fable 5 生成的戒指优于竞品，但与人类作品相比仍有差距。| 图片来源：Safe.ai

人类评估员仍无法被取代

研究团队测试了能否用 AI 评审员取代昂贵的人工评估。答案很明确：AI 评审员对新模型的评分过于宽松。对于 GPT-5.5，AI 评估者的评分几乎高出三倍。对于 Opus 4.8，则高出约两倍半。自动化评审确实能正确排序，但具体数值偏差很大。

根据 CAIS 的说法，原因在于：要公正评判交付成果，需要在正确的专业软件中打开文件，正确操作该软件，并像付费客户那样形成判断。这种实操性的软件使用恰恰是当前 AI 智能体最不擅长的。AI 评审员会遇到与其评估的 AI 工作者相同的局限。GPT-5.5 伪造的渲染图就是一个很好的例子：识破这一伎俩需要打开 3D 模型并检查实际几何结构。

为了让模型充分展示能力，研究团队让它们在开发者日常使用的工具中运行，例如 Claude Code 和 Codex CLI。这些工具被扩展了直接操作图形程序的能力。工作环境是一台装有超过 30 款专业应用的虚拟 Linux 机器，包括 Blender、GIMP 和 Audacity。每个项目最多可获得 24 小时的计算时间。该设置还采用了一个批评循环：第二个 AI 智能体像苛刻的客户一样严格审查输出，然后第一个智能体根据反馈修改其作品。

在大多数项目中，AI 仍未能达到专业水准。博客文章中展示的三个 Fable 5 成果，没有一个能算作完成品。但作者表示，自动化率在一年内的提升是迅速的，这直接反映了远程工作自动化的推进速度。
