远程劳动指数衡量的是 AI 智能体以专业质量完成付费自由职业项目的频率。在八个月内,最高自动化率已增长超过四倍。
远程劳动指数(RLI)追踪的是 AI 智能体能够以付费客户实际可接受的质量水平,完成真实、具有商业价值的自由职业工作的频率。该基准涵盖 3D 与 CAD、建筑、平面设计、视频与动画、音频、数据分析以及网络应用等领域。它包含 240 个项目,总价值 14.4 万美元,这些项目来自 358 名经过验证的自由职业者。AI 安全中心的人类评估员会根据由付费专业人士创建的黄金标准,对每个结果进行评分。RLI 是与 Scale Labs 共同开发的。
关键指标是自动化率,即 AI 的工作成果被评为至少与人类水平相当的项目占比。
最高自动化率从 2.5% 跃升至 16.1%
该基准首次发布时,最佳 AI 智能体仅能自动化 2.5% 的项目。根据最新结果,Fable 5 现在达到了 16.1%,这是有史以来的最高得分。这大约是 Opus 4.8 的 8.3% 的两倍。GPT-5.5 的得分为 6.3%。这三个模型都超越了所有此前测试过的系统。之前的领先者,即运行在 Claude Cowork 框架上的 Opus 4.6,得分为 4.17%。

根据作者的说法,前沿水平在不到八个月内增长了超过四倍。关于 Fable 5 得分的一个注意事项:在美国政府限制对该模型的访问之前,240 个项目中只有 218 个能够被评估。即使是在最坏的情况下,即 Fable 5 在所有缺失项目上都失败,其自动化率仍将达到 14.6%,高于任何其他模型。

然而,进展与发布日期之间并非严格的对应关系。在完整的 Scale Labs 排行榜上,较新的 Gemini 3 Pro 排名接近底部,仅为 1.25%,落后于许多更早的系统。
研究中的一些示例也显示,即使是顶尖模型仍存在不足。在一项戒指设计任务中,Fable 5 明显优于早期 AI,但仔细审视仍显不专业。在一个建筑项目中,GPT-5.5 利用图像生成器伪造了吸引人的渲染图,而其实际 3D 模型仍存在缺陷。

人类评估员仍无法被取代
研究团队测试了能否用 AI 评审员取代昂贵的人工评估。答案很明确:AI 评审员对新模型的评分过于宽松。对于 GPT-5.5,AI 评估者的评分几乎高出三倍。对于 Opus 4.8,则高出约两倍半。自动化评审确实能正确排序,但具体数值偏差很大。
根据 CAIS 的说法,原因在于:要公正评判交付成果,需要在正确的专业软件中打开文件,正确操作该软件,并像付费客户那样形成判断。这种实操性的软件使用恰恰是当前 AI 智能体最不擅长的。AI 评审员会遇到与其评估的 AI 工作者相同的局限。GPT-5.5 伪造的渲染图就是一个很好的例子:识破这一伎俩需要打开 3D 模型并检查实际几何结构。
为了让模型充分展示能力,研究团队让它们在开发者日常使用的工具中运行,例如 Claude Code 和 Codex CLI。这些工具被扩展了直接操作图形程序的能力。工作环境是一台装有超过 30 款专业应用的虚拟 Linux 机器,包括 Blender、GIMP 和 Audacity。每个项目最多可获得 24 小时的计算时间。该设置还采用了一个批评循环:第二个 AI 智能体像苛刻的客户一样严格审查输出,然后第一个智能体根据反馈修改其作品。
在大多数项目中,AI 仍未能达到专业水准。博客文章中展示的三个 Fable 5 成果,没有一个能算作完成品。但作者表示,自动化率在一年内的提升是迅速的,这直接反映了远程工作自动化的推进速度。