Hacker News 热门(buzzing.cc 中文翻译)
精选
80AI 编辑部评分,满分 100

Anthropic 报告递归式自我改进进展

2026-06-05 04:12· 73天前· meetpateltech
AI 导读

Anthropic 近日发表文章《当人工智能自我构建:我们在递归式自我改进方面的进展》,报告其在递归式自我改进方面的进展,探讨 AI 系统自我构建的能力。该文章发布在 Hacker News 上。

推荐理由

Anthropic这篇不是PR,是用真实内部数据画的递归路线图,代码产量8倍、实验提速50倍,让“人类设定方向、AI干活”不再只是愿景,每个从业者都该认真读一遍。

正文 · AI 翻译

当 AI 开始自我构建

我们朝着递归式自我改进的进展及其影响。

在 AI 发展史的大部分时间里,人类驱动着其开发周期的每一个步骤。但在 Anthropic,我们正将 AI 开发中越来越多的部分委托给 AI 系统本身,这正在加速我们的工作。

如果这一趋势推进得足够远,并给予足够的算力,它将指向一个能够完全自主设计和开发其继任者的 AI 系统。这被称为递归式自我改进。我们尚未达到那一步,递归式自我改进也并非不可避免。但它可能比大多数机构所准备应对的时间点来得更早。

利用公开基准测试以及 Anthropic 内部此前未公开的数据,Anthropic 研究所正在展示 AI 已经在加速 AI 系统的开发。仅举一例:如今,Anthropic 工程师每季度提交的代码量平均是 2021 年至 2025 年期间的 8 倍。

本文讨论的技术趋势表明,AI 系统在未来几年将变得更加强大。这些趋势具有巨大的影响。能够自我构建的 AI 将成为技术史上的一个重大发展——它可能在科学、医疗保健及其他领域为世界带来巨大的福祉。但完全的递归式自我改进也可能增加人类失去对 AI 系统控制的风险。如果系统能够完全构建自己的继任者,那么我们保护它们、监控它们以及塑造它们行为的方式都将变得更为重要。

2021–2023 年

构建第一个 Claude

在早期,Anthropic 的工作看起来与其他科技公司无异:人们在笔记本电脑上编写代码和文档。

2023–2025 年

聊天机器人

人们使用早期的聊天机器人来协助部分流程,例如生成简短的代码片段并将输出内容复制到文本编辑器中。

2025–2026 年

编码智能体

随着智能体变得更强,它们能够自行编写和编辑代码,有时甚至是整个文件。

今天

自主智能体

智能体现在可以自行运行代码,并将数小时的工作委托给其他智能体。

20XX 年?

闭环

未来,AI 智能体可能变得足够强大,能够自行构建和训练模型。如果这种情况发生,未来版本的 Claude 可能会由 Claude 自身持续改进。

来自外部世界的证据

AI 模型改进的速度正在加快。它们能够独立可靠完成的任务时长,大约每四个月翻一番,而此前的趋势是每七个月翻一番。2024 年 3 月,Claude Opus 3 能够完成人类大约需要四分钟完成的软件任务。一年后,Claude Sonnet 3.7 能够处理大约需要一个半小时的任务。又过了一年,Claude Opus 4.6 能够处理 12 小时的任务。¹ 如果这一趋势持续下去,熟练人员需要数天才能完成的任务今年内可能进入其能力范围。到 2027 年,AI 系统将能够完成人类需要数周才能完成的任务。

同样的模式也出现在编码和研究基准测试中。基准测试衡量模型在特定领域的表现,当模型达到接近 100% 的性能时,该基准即被“饱和”。² SWE-bench 是一项针对真实世界软件工程的标准测试:它向模型提供一个实际的开源代码库和一个真实的错误报告,要求模型编写代码修改以修复问题,并通过项目自身的测试。模型在两年内从个位数低分发展到饱和该基准测试。

CORE-Bench 测试模型能否复现现有研究,这是它们进行原创研究的先决条件。它向 AI 模型提供一篇已发表论文背后的代码和数据,要求模型重新运行所有内容,并确认能够复现论文的结果。AI 系统从 2024 年约 20% 的成功复现率,发展到十五个月后饱和该基准测试。运行衡量模型完成长周期任务能力的基准测试的 METR 发现,Claude Mythos Preview 能够“至少”工作 16 小时,并且“处于 [METR] 在没有新任务的情况下所能测量的上限”。

公开基准测试能揭示这些系统的很多能力,但它们无法展现 AI 系统在加速 AI 自身发展方面所产生的影响。要了解这一点,我们需要来自 Anthropic 等 AI 公司内部的直接证据。

Anthropic 内部的证据

构建前沿模型需要两大类工作。一类是工程:编写代码、搭建基础设施、监督模型训练。另一类是研究:决定进行哪些实验、解读实验结果、确定下一步该尝试哪些思路。

在工程和研究两个领域,情况是一致的。在工程方面,可以交给 Claude 一个定义不明确的问题,让它自己找出解决方案;人类提供目标,但不再需要提供方法。在研究方面,Claude 在执行一个定义明确的实验时,已经能与熟练的人类匹敌甚至超越他们。然而,在工程和研究两个领域,当涉及运用判断力来选择目标时,Claude 仍存在巨大的性能差距。这正是当今 AI 与未来能够自主设计自身继任者的系统之间的差距。

在 Anthropic,员工随着经验增长,通常会承担更开放、更重要的任务。初期,他们执行别人指定的任务,比如“导出按钮坏了,请修复”。有了经验后,他们会接手一个目标并自行设计方案,例如“调查网络在重负载下变慢的原因”。到了最高级别,他们需要决定哪些问题值得投入精力:“团队下个季度应该构建什么?”我们可以利用 Anthropic 的内部数据,看看 Claude 在处理这些不同类型任务方面已经达到了何种水平。

Claude 编写了 Anthropic 相当大比例的代码。截至 2026 年 5 月,我们合并到 Anthropic 代码库中的代码有超过 80% 是由 Claude 编写的。在 Claude Code 于 2025 年 2 月以研究预览版形式推出之前,这个数字还只是个位数。这一转变也体现在每位工程师的产出量上。在 Anthropic 成立的头四年(2021-2024 年),每位工程师每天合并的代码行数保持稳定,然后在 2025 年开始攀升,当时 Claude 开始运行代码,而不仅仅是建议代码供工程师复制粘贴。2026 年,当模型开始能够在更长的时间跨度内自主工作时,增长斜率再次变陡。这两个拐点如下图所示。在 2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。这是因为大部分代码是由 Claude 编写的,工程师负责指导和审查,而不是亲自输入。

需要说明一点:代码行数是一个不完美的衡量标准,因为它衡量的是数量而非质量。因此,2026 年第二季度每位工程师每天 8 倍的代码行数增长,几乎肯定夸大了真实的生产力提升。尽管如此,它确实表明了一种加速趋势。在 Anthropic,我们并不根据人们写了多少行代码来奖励他们;相反,团队成员之所以产出更多代码,仅仅是因为他们正在使用 AI 系统来编写更多代码。

代码行数的增加与主观感受到的大幅生产力提升是吻合的。在 2026 年 3 月对来自 Anthropic 各研究团队的 130 名员工进行的一项调查中,受访者的中位数估计是,在使用 Mythos Preview 的情况下,对于他们无论如何都会从事的那类项目,他们的产出量大约是完全没有 AI 模型辅助时的 4 倍。我们预计 3 月份的真实提升幅度会略低一些。尽管如此,我们认为这一总体说法是可信的,并且与我们其他的观察结果一致:Anthropic 相当大比例的技术人员完成核心工作的速度,比没有 AI 辅助时快了数倍。

我们还看到证据表明,Anthropic 的员工正在使用 Claude 来完成那些原本根本不会发生的工作,比如构建探索性工具和处理长期搁置的清理任务。例如,在 2026 年 4 月,Claude 交付了超过 800 项修复,将某一类 API 错误减少了千倍。负责监督 Claude 的工程师估计,人类需要四年才能完成这项工作;解决他人的 bug 既缓慢又费神,而且人类很难同时将那么多不熟悉的上下文记在脑中。

媒体内容 · 前往原文查看
大约一年前,我开始大力推行“Claude 化”。那是一段疯狂的冒险,而我自己上一次写代码已经是大约 5 个月前的事了。
*Anthropic 员工

Claude 编写的代码是“好的”,并且还在不断改进。“好代码”意味着两件事:它能工作,并且其编写方式能让另一位工程师理解并在此基础上进行构建。就第一个标准而言,证据是明确的。Anthropic 员工纠正、引导 Claude 或在中途从 Claude 手中接管任务的频率,在过去一年中持续下降,即使在最复杂、最开放式的任务上也是如此。这意味着那些没有明确规范、工程师也不确定答案是什么样的问题。从下图中 Claude 在不同难度任务上随时间变化的成功率可以明显看出这一点。Claude 编写的代码是能工作的。

Line graph showing the Claude Code session success rate on four different types of tasks—trivial tasks, routine tasks, substantial tasks, and open-ended problems—with six different models: Claude Sonnet 4.5, Claude Opus 4.5, Claude Opus 4.6, Mythos Preview (internal access), Mythos Preview, and Claude Opus 4.7.
如何解读:会话成功与否由 Claude 评判器判定;如果 Claude Code 智能体明显成功完成了用户的任务且无需纠正,则该会话被视为成功。工作负载的变化可能导致成功率的短期波动。

在最开放式的任务中,Claude 的成功率在 2026 年 5 月达到了 76%,六个月间提升了 50 个百分点。举一个该难度层级任务的例子:一次例行升级导致数万个训练任务开始崩溃。一位工程师将 Claude 指向这个实时故障,只提供了少量文本内容和集群访问权限。通过逐一排查正在运行的任务并测试每个环境设置,Claude 隔离出了那个触发崩溃的晦涩调试标志,可靠地复现了该问题,并确认了修复方案。在大约两小时内,Claude 完成了通常需要两到三天的工作量。

第二个标准是编写其他工程师能够理解并在此基础上继续开发的代码。在这方面,人类与 AI 之间的差距依然存在,但正在迅速缩小。Anthropic 内部员工尚未达成完全共识,但许多人认为,在 2025 年底,Claude 编写的代码质量仍低于人类编写的代码,而如今两者已大致持平。我们预计在今年内,Claude 的代码质量将超越人类。

这改变了 Anthropic 现在审查自身代码的方式。对我们代码库的拟议修改,在合并之前,现在会由一位自动化的 Claude 审查员进行读取,以查找错误、安全漏洞及其他缺陷。利用这一工具,我们进行了一项回顾性分析,发现如果对代码库的每一次修改都进行自动化的 Claude 审查,那么 claude.ai 上过去事故背后大约三分之一的错误,在进入生产环境之前就会被发现。编写这些代码的工程师是世界上最擅长构建这些系统的人之一。而 Claude 现在正在捕捉他们遗漏的错误。

在 2025 年底,Claude 编写的代码质量略低于 Anthropic 内部人类编写的代码,如今两者大致持平,我们预计在今年内,Claude 的代码质量将明确超越人类。

Claude 非常擅长通过运行实验来达成他人设定的目标。每次 Anthropic 发布新模型时,我们都会运行同一个测试:给 Claude 一段用于训练小型 AI 模型的代码,并要求它在不改变正确性检查结果的前提下,尽可能让这段代码运行得更快。目标和成功指标都是事先确定的,因此 Claude 的任务就是通过重写代码、运行、计时、再重复这一流程来寻找加速方案。这相当于实验研究循环的一个微型版本。2025 年 5 月,Claude Opus 4 平均能将初始代码加速约 3 倍。到 2026 年 4 月,Claude Mythos Preview 已能达到约 52 倍的加速效果。作为参照,一位熟练的人类研究人员需要四到八小时才能实现 4 倍的加速。在这个研究工作流程的环节中——即在明确定义的实验内优化步骤——Claude 在不到一年的时间里,从极其有用进化到了超越人类。

当前的大致格局是:“人类提出想法,而模型能够以比以往快一个数量级的速度来实施、测试和评估这些想法。”

Claude 在自主提出实验方面正变得越来越强。2026 年 4 月,Anthropic 首次展示了 Claude 端到端运行一个开放式研究项目的成果。基于 Claude 的智能体被赋予了一个 AI 安全领域的开放性问题——大致是:一个较弱的模型能否可靠地监督一个更强的模型?——并让它们自行解决。这涉及提出假设、测试假设、与并行智能体共享发现,以及迭代优化。该任务有一个明确的性能“下限”和“上限”:下限是弱监督者独立完成时的表现;上限是强模型在基于正确答案训练后能达到的水平。两位人类研究人员在大约一周的时间内,弥补了约 23% 的差距;而智能体则在累计 800 小时内弥补了 97% 的差距,消耗了大约 18,000 美元的计算资源。这项工作存在一些局限性:其结果未能完美迁移到生产级规模的模型上,并且问题设定和评分标准仍由人类完成。但在此框架内,所有实验均由智能体自行设计。设定方向是人类扮演的唯一有意义的角色。

克劳德在短短一两天内,在我几乎没怎么帮忙的情况下完成了这一切。我觉得,如果一位[初级同事]在同样时间内拿着这样的成果来找我,我会感到颇为惊喜。未来已来。

克劳德在引导研究过程走向研究成果方面越来越擅长。我们审视了真实的克劳德代码会话(时间跨度为 2026 年 1 月至 3 月),在这些会话中,Anthropic 的研究人员正与克劳德合作解决一个开放式的探究性问题,比如弄清楚某次训练运行为何反复崩溃,或者某个模型为何在某个基准测试中得分很低。在每种情况下,我们都发现研究人员曾一度偏离方向:他们沿着某个方向探索,导致会话偏离正轨,之后才重新回到正确路径上。接着,我们向不同的克劳德模型展示了会话偏离方向之前的工作内容,并询问它们下一步会怎么做。另一个能够看到会话最终走向的克劳德模型,则负责评判是 AI 还是人类提出了更好的下一步行动方案。

因为我们特意挑选了那些我们知道人类的选择尚有改进空间的时刻(共 129 个),所以这并非模型判断与人类判断之间的直接对比。这些时刻为我们提供了一系列真实且具有挑战性的场景,在这些场景中,正确的下一步并不显而易见,而人类的选择则作为一个有用的标尺,用于比较模型性能随时间的变化。根据这一衡量标准,我们 2025 年 11 月的最佳模型(Opus 4.5)在 51% 的情况下胜过了人类的选择;到了 2026 年 4 月(Mythos Preview),这一比例增长到了 64%。研究的日常工作很大程度上就是由一连串这样的下一步决策组成的,这使得该指标成为衡量模型最终能否自主开展调查的相关标准。我们将这一结果视为一个早期信号,表明 AI 系统在做出 AI 研究所依赖的那种判断决策方面正变得越来越擅长。

Bar graph with the header "Can the model pick a better next step than the human?" The bar graph shows the performance of nine different models: Claude 3 Haiku, Claude Sonnet 4, Claude Sonnet 4.5, Claude Haiku 4.5, Claude Opus 4.5, Claude Sonnet 4.6, Claude Opus 4.6, Claude Opus 4.7, and Claude Mythos Preview.
如何解读:实际天花板线衡量的是由一个能够看到整个会话(包括其最终结果)的模型所撰写的“理想”答案。
人类目前的比较优势仍然在于能够看到更宏观的图景,并跳出当前任务的局限进行思考。

Anthropic 未来的工作形态可能会是怎样的?

有证据表明,在 AI 开发流程的每一步,人类的角色都在收窄。一旦人类编写的代码与 AI 生成的代码质量达到同等水平,人类将完全停止编写代码,转而只负责审查代码。但如果人类审查代码的速度赶不上 Claude 生成代码的速度,那么人工审查就会成为 AI 开发的瓶颈。同样,一旦 Claude 能够运行实验,问题就变成了“这些实验中哪些值得运行?”简而言之,“执行”环节(即编写代码、运行实验、产出结果)现在几乎不消耗人类时间,即便在算力上仍有成本。

就目前而言,人类的一个比较优势领域是研究品味和判断力,包括选择哪些问题至关重要、哪些结果值得信赖,以及何时某种方法是一条死胡同。

工作(和生活)过去是建立在人与人之间互施小恩小惠的礼物经济之上的。“你能帮我让这个脚本跑起来吗?”……每一次请求都产生一点人情债,一点相互间的关注。[Claude] 更快,它不产生任何人情债,但每一次求助都意味着一次失去的人类协作机会。
在一切顺利的日子里,我不禁觉得我所做的一切都无关紧要,一切都被自动化了,而且比我做得更好、更快。但随后也会有这样的日子:一切全都崩溃,而我却搞不懂原因,我意识到自己已经不知道我到底在忙些什么了。

如果我们错了呢?

对上述证据的一个自然反驳是,那些仍由人类掌控的工作——即选择要解决哪些问题——才是最重要的。没有这种判断力,Claude 只是一个能干的助手,而不是一个能够独立推动 AI 进步的系统。

目前尚不明确,当今的训练方法和架构是否真能解锁这种能力。但人工智能的进步很少来自“灵光一现”的时刻。在 AI 的近代史上,确实有过几次这样的时刻,比如 Transformer 架构或混合专家模型,但范式转变的想法往往相隔数年才出现一次。在这期间,大多数进步都是渐进式的:我们把某个东西放大,看看哪里出了问题,修复它,然后再试一次。这正是 Claude 现在擅长的流程。爱迪生说过,天才是 1% 的灵感加上 99% 的汗水。但我们看到,汗水正在变得越来越自动化。越来越清楚的是,推动前沿进步的许多工作都是可以自动化的;大规模的研究进展主要取决于工具和资源,它们决定了你能以多快的速度进行实验、一次能进行多少实验,以及你能多快获得结果。

即使我们假设 Claude 永远无法拥有良好的研究品味,对我们证据的保守解读仍然意味着复合加速。如果人类将大部分时间花在那些只占个位数百分比、决定方向的工作上,而让 Claude 处理其余部分,那就意味着每位工程师或研究人员所引导的工作量比以前多得多。我们看到的证据表明,Anthropic 的员工既在加快速度,也在覆盖更广的领域。实际上,这意味着 AI 已经让 Anthropic 的运转速度远快于有效 AI 工具出现之前。

不那么保守的解读是,关于 Claude 研究判断力正在提升的早期证据——尽管目前还很狭窄——表明这种能力也在进步。“研究品味”可能只是另一种 AI 能力,AI 系统在一段时间内无法胜任,然后就会变得擅长。我们在其他定性技能上也看到过类似的模式,比如 AI 系统能够解释一个笑话为什么好笑、展示心智理论,以及解决语言谜题。

可能的未来

接下来会发生什么,取决于两件事:这一趋势是否持续,以及如果持续,我们选择如何应对。我们至少可以设想三种未来情景:

  1. 这一趋势正在放缓,但当今的 AI 能力已广泛扩散。本文展示了许多指数级增长轨迹,但这些轨迹实际上可能呈现 S 形曲线。我们或许正接近曲线的拐点——规模收益递减,增长曲线趋于平缓,最终走向平坦。区分优秀研究者与卓越研究者的关键,或许是一种无法通过扩大训练投入(如算力和数据)来获得的能力。若果真如此,突破这一瓶颈就需要全新的思路,例如采用能够取代当前所有前沿模型所使用的 Transformer 架构的新架构方案。 另一种可能性是,制约 AI 发展的瓶颈可能在于供应链而非模型本身:推进和扩散前沿技术所需的能源和算力可能超出当前可用水平。芯片制造、电网扩容或互联带宽的进展速度,而非智能本身,可能成为真正的约束。我们也不能排除 AI 生态系统遭遇外部冲击导致发展急剧放缓的可能性,例如算力或电力供应突然减少——这两种情况都会拖慢进展,并增加实验室的前期投资成本。此外,我们可能尚未预见到其他阻碍发展的因素。 即使模型能力冻结在当前水平,我们仍预期世界将发生重大变化。Glasswing 项目便是一个早期迹象:在最初几周内,Mythos Preview 就在全球最重要的系统中发现了超过一万个高危和严重级别的软件漏洞——以至于网络防御的瓶颈已从发现漏洞转向了及时修补漏洞。而当前模型向更广泛经济领域的扩散仍处于早期阶段:一家 100 人的公司正日益能够完成过去 1000 人公司的工作量,因为每位员工都将坐拥一个由智能体组成的金字塔。 我们列出这一情景是为了完整性,但我们认为它不太可能发生。我们所能测量的每一项能力——包括那些感觉"更模糊"的指标,如代码质量和开放式任务的成功率——迄今为止都遵循着同样的增长曲线,我们尚未看到这条曲线出现拐点。在我们考虑的三种未来情景中,这一种将给政府和社会最充裕的适应时间。我们更担心接下来的两种情景,它们的发展速度更快,留给准备的余地也小得多。
  2. AI 实验室持续观察到效率的复合增长。在这种情境下,AI 开发将大幅自动化,但人类仍负责设定研究方向并评判结果。随着时间推移,使用 AI 系统的组织效率会越来越高,因此我们可以预期,组织中每个人的生产力将获得显著倍增。100 人的公司能够完成原本需要 10,000 人或 100,000 人组织才能完成的工作。这将彻底改变知识工作和政府服务,但也可能被用于有害目的——从对全体人口进行威权监控,到针对每个个体量身定制操纵手段、并以任何人类团队都无法企及的规模运行的影响力行动。像 Anthropic 这样的公司,人类的角色将发生转变。人们将与 AI 系统合作,扩大研究规模并产生新的洞见,共同构建验证 AI 输出可信度所需的系统。我们在此列出的证据表明,我们很可能正走向这一情境。但加速流程的某个环节,往往只是将瓶颈转移到别处:整体速度受限于那些尚未提速的部分。在计算领域,这被称为阿姆达尔定律,同样的逻辑也适用于组织。Anthropic 已经遇到了阿姆达尔定律的一个典型特征:随着我们在组织内部推送更多代码,人工代码审查已成为新的瓶颈。我们在工程部门之外也遇到了这种摩擦。由于 Anthropic 员工与高性能模型合作,新想法、新举措、新工具和新模拟层出不穷——数量远超我们当前能够跟进的能力。组织发现并解决这些瓶颈的速度,可能是一项会随时间推移而提升的技能,并且可能成为任何组织最重要的技能。
  3. AI 系统自身将具备完整的递归式自我改进能力,并开始构建它们的后继者。如果能力提升的技术趋势持续下去,且 AI 系统能够发展出变革性人类创造力所固有的能力,那么 AI 系统自行设计与优化自身是合理的。在这个世界里,AI 发展进程的速度将完全由 AI 系统可用的算力(或在算法训练或推理中发现各种效率提升的速度)决定。人类在其发展中的作用将大幅减弱,很可能将大部分精力转向对 AI 系统运行的、不断扩大的“虚拟实验室”进行监督、验证与确认。我们预计,具备自动化 AI 研发能力的系统将拥有可迁移至其他科学领域的技能,从而开始革新其他领域。 在这个未来中,对齐问题如何得到解决——或未能解决——是我们最不确定的部分。模型可能被证明足够对齐,并具备足够的研究品味,从而发现并实现我们尚未触及的新颖解决方案。如果情况并非如此,它们也可能足够明智地暂停发展。另一种可能是,当前模型中偶尔出现的未对齐问题,会随着模型构建其后继者而不断累积,变得越来越频繁,但我们对它的理解却越来越浅,直至最终失去对模型的控制。我们有可能无法构建、集成并验证那些我们所需、用以判断我们实际处于哪条趋势线的工具。 我们对这个世界会是什么样子缺乏良好的直觉,因为当前的经济是由人类和人类构建的工具驱动的。就其本质而言,一个由快速递归式自我改进驱动的世界,可能会被自我改进的模型所主导,因为其能力将完全超越人类,并且该模型将在更广泛的经济领域内扩散。如果人类劳动力不再具有竞争力,很难预测经济会变成什么样。 即使模型开发变得完全自动化和递归化,我们也无法预测这对大多数人的日常生活意味着什么。阿姆达尔定律在此同样适用。递归式智能可能带来《仁爱之机》中概述的许多益处,并在某些领域迅速实现。我们预计,具身智能(即机器人技术)可能会紧随递归式智能之后,并遵循类似的路径,以更低的成本实现递增的回报。更强大的智能可能帮助我们更快地在物理世界中建造事物,开展更多拯救生命的药物的高效临床试验,并开发新型的协作方式。 但仅实现递归式改进,并不意味着工业生产方式、社会组织形式或市场运行方式会立即改变。更强的智能无法了解一种药物在数十年使用中的效果,无法在宪法规定的期限之前举行选举,也无法在周末把一个陌生人变成老朋友。对大多数人而言,这个未来的感知节奏仍将由各种瓶颈决定,即使上游的实验室以算力的速度运行。这种碰撞——递归式智能以越来越快的速度自我构建,与人类、人际关系和治理的世界相遇——是我们无法预测的未来的另一部分。

我们应当怎么做?

如果能够有效减缓这项技术的发展,为自己争取更多时间来应对其深远影响,我们认为这很可能是一件好事。但如果减缓发展只是让最不谨慎的行动者在技术上迎头赶上,那反而可能让所有人更不安全。在没有全球协调机制的情况下,企业和政府将不得不在竞争和地缘政治压力下,就安全问题做出艰难抉择。

我们认为,如果世界能够拥有减缓或暂时暂停前沿 AI 发展的选项,以便让社会结构和 AI 对齐研究能够跟上技术进步的步伐,这将是一件好事。Anthropic 研究所将(与众多其他机构合作)开展研究并采取行动,帮助构建可信的减缓或暂停所需的系统。这些系统将使前沿 AI 开发者能够验证全球其他方是否确实已经停止或减缓了发展,并确保恶意行为者无法利用协调减缓的幌子秘密抢先发展。如果此类系统存在,我们预计,只要其他处于或接近前沿的开发者也能以可验证的方式同样做到,我们就会减缓或暂时暂停发展。

有意义的减缓或暂停,需要多个国家中多个处于或接近前沿、资源充足的实验室同意在相同条件下停止。同时,每个实验室都必须能够验证其他方确实已经停止。由于 AI 系统的独特特性,这个军备控制问题中的可检测性(一个比可验证性更低的标准)要素,比其他技术要困难得多。训练运行远比导弹发射井更容易隐藏,其输入是通用性的,而悄悄违约的动机极其巨大,因为当其他人暂停时,继续发展的一方就可能继承领先地位。一个可信的暂停还必须明确:触发条件是什么、解除条件是什么、以及由谁来裁决。

这些在原则上并非完全不可能实现——世界已经为其他复杂技术建立了核查机制(例如《中程核力量条约》)——但这些机制花费了数十年时间才建立起基础设施和信任。我们没有那么长时间。相比之下,一家实验室单方面暂停是立即可行的,但收效甚微:它会改变谁是领跑者,但无法建立目前缺失的更广泛的审议进程。

在未来几个月,我们将组织对话,让政策制定者、研究人员、公民社会和其他人工智能公司能够帮助回答本文提出的一些问题,特别是关于完全递归式自我改进,以及如何为协调和审议创造更好的选择。我们将公布讨论成果。共同探讨这些问题的窗口期已经到来,人工智能公司之外的人也应该参与这场审议。

本文由 Marina Favaro 和 Jack Clark 共同撰写,Santi Ruiz 提供了编辑支持。Shan Carter、Romello Goodman 和 Nikki Makagiansar 根据 Brian Calvert 和 Jun Shern Chan 收集的数据制作了可视化内容。Daniel Freeman、Jim Baker、Max Young、Sarah Pollack、Francesco Mosconi、Holden Karnofsky、Andy Jones、Kevin Troy、Chloe Lubinski、Anton Korinek、Meg Tong、Andrew Ho、Dan Altman、Drake Thomas、Jack Shen、Sasha de Marigny 和 Avital Balwit 提供了反馈意见。


脚注

  1. METR 的关键指标告诉你,人工智能系统在一组任务中达到 50% 可靠性的时间跨度,尽管在 80% 可靠性下趋势线看起来是一样的。
  2. 特别是当它们转向更开放的形式和更困难的任务时(例如奥林匹克级别的数学),基准测试往往在达到 100% 之前就饱和了,原因是问题与答案集中存在错误,例如模糊的问题陈述和无法解答的问题。
  3. Anthropic 领导层公开估计,我们 90% 或更多的代码(包括脚本和实验性代码)是由 Claude 编写的。我们超过 80% 的数据衡量的是可归因于 Claude 的合并到生产环境中的代码行占比。这是一个更保守的衡量方式,体现在两个方面:我们的归因流程存在缺口,并且那些未归因于 Claude 的代码行包括自动生成的代码和其他同样非人类手写的产物。
  4. 代码产量的激增正给所有人共享的基础设施带来压力。GitHub——全球大多数软件构建的平台——在 2025 年全年见证了大约十亿次代码提交;到 2026 年年中,它每周看到 2.75 亿次提交,按此速度全年将达到约 140 亿次。该公司的首席运营官表示,为了跟上这一速度,他们正在“极其努力地”提升容量。
  5. 关于本次调查方法的更多细节,在 Claude Opus 4.7 系统卡的第 2.3.5 节中进行了讨论。
  6. 许多受访者可能没有仔细考虑如何解释问题定义中的各种偏差或细微之处,而 METR 最近的研究表明,开发者对 AI 生产力提升的估计可能被高估。
  7. 加速幅度的大小在很大程度上取决于初始代码留有多少改进空间,并且不应将其解读为现实世界中的训练加速。因此,绝对的倍数并非此处应关注的数字。更具参考价值的是,该实验设置使得能够进行同类对比,既包括不同模型之间的对比(过去一年间约 3 倍到约 52 倍),也包括与熟练人类在相同任务上四到八小时内的对比(约 4 倍)。
  8. 作为对评判者偏差的检验,我们在另一组 127 个时刻上运行了相同的测试,在这些时刻中,人类的下一步行动已经很强(与原始测试集相反,原始测试集中人类的方向尚有改进空间)。在那里,模型的建议被认为更好的情况仅占约 20%。

* 本文中引用 Anthropic 员工的言论均来自内部讨论,并经许可使用。它们反映的是截至 2026 年 5 月的个人观点,而非公司官方立场。

来源:Hacker News 热门(buzzing.cc 中文翻译) · anthropic.com

事件后续 · 4查看事件全部 →

Anthropic 报告递归式自我改进进展

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-05 04:12·73天前·meetpateltech
AI 导读

Anthropic 近日发表文章《当人工智能自我构建:我们在递归式自我改进方面的进展》,报告其在递归式自我改进方面的进展,探讨 AI 系统自我构建的能力。该文章发布在 Hacker News 上。

正文 · AI 翻译

当 AI 开始自我构建

我们朝着递归式自我改进的进展及其影响。

在 AI 发展史的大部分时间里,人类驱动着其开发周期的每一个步骤。但在 Anthropic,我们正将 AI 开发中越来越多的部分委托给 AI 系统本身,这正在加速我们的工作。

如果这一趋势推进得足够远,并给予足够的算力,它将指向一个能够完全自主设计和开发其继任者的 AI 系统。这被称为递归式自我改进。我们尚未达到那一步,递归式自我改进也并非不可避免。但它可能比大多数机构所准备应对的时间点来得更早。

利用公开基准测试以及 Anthropic 内部此前未公开的数据,Anthropic 研究所正在展示 AI 已经在加速 AI 系统的开发。仅举一例:如今,Anthropic 工程师每季度提交的代码量平均是 2021 年至 2025 年期间的 8 倍。

本文讨论的技术趋势表明,AI 系统在未来几年将变得更加强大。这些趋势具有巨大的影响。能够自我构建的 AI 将成为技术史上的一个重大发展——它可能在科学、医疗保健及其他领域为世界带来巨大的福祉。但完全的递归式自我改进也可能增加人类失去对 AI 系统控制的风险。如果系统能够完全构建自己的继任者,那么我们保护它们、监控它们以及塑造它们行为的方式都将变得更为重要。

2021–2023 年

构建第一个 Claude

在早期,Anthropic 的工作看起来与其他科技公司无异:人们在笔记本电脑上编写代码和文档。

2023–2025 年

聊天机器人

人们使用早期的聊天机器人来协助部分流程,例如生成简短的代码片段并将输出内容复制到文本编辑器中。

2025–2026 年

编码智能体

随着智能体变得更强,它们能够自行编写和编辑代码,有时甚至是整个文件。

今天

自主智能体

智能体现在可以自行运行代码,并将数小时的工作委托给其他智能体。

20XX 年?

闭环

未来,AI 智能体可能变得足够强大,能够自行构建和训练模型。如果这种情况发生,未来版本的 Claude 可能会由 Claude 自身持续改进。

来自外部世界的证据

AI 模型改进的速度正在加快。它们能够独立可靠完成的任务时长,大约每四个月翻一番,而此前的趋势是每七个月翻一番。2024 年 3 月,Claude Opus 3 能够完成人类大约需要四分钟完成的软件任务。一年后,Claude Sonnet 3.7 能够处理大约需要一个半小时的任务。又过了一年,Claude Opus 4.6 能够处理 12 小时的任务。¹ 如果这一趋势持续下去,熟练人员需要数天才能完成的任务今年内可能进入其能力范围。到 2027 年,AI 系统将能够完成人类需要数周才能完成的任务。

同样的模式也出现在编码和研究基准测试中。基准测试衡量模型在特定领域的表现,当模型达到接近 100% 的性能时,该基准即被“饱和”。² SWE-bench 是一项针对真实世界软件工程的标准测试:它向模型提供一个实际的开源代码库和一个真实的错误报告,要求模型编写代码修改以修复问题,并通过项目自身的测试。模型在两年内从个位数低分发展到饱和该基准测试。

CORE-Bench 测试模型能否复现现有研究,这是它们进行原创研究的先决条件。它向 AI 模型提供一篇已发表论文背后的代码和数据,要求模型重新运行所有内容,并确认能够复现论文的结果。AI 系统从 2024 年约 20% 的成功复现率,发展到十五个月后饱和该基准测试。运行衡量模型完成长周期任务能力的基准测试的 METR 发现,Claude Mythos Preview 能够“至少”工作 16 小时,并且“处于 [METR] 在没有新任务的情况下所能测量的上限”。

公开基准测试能揭示这些系统的很多能力,但它们无法展现 AI 系统在加速 AI 自身发展方面所产生的影响。要了解这一点,我们需要来自 Anthropic 等 AI 公司内部的直接证据。

Anthropic 内部的证据

构建前沿模型需要两大类工作。一类是工程:编写代码、搭建基础设施、监督模型训练。另一类是研究:决定进行哪些实验、解读实验结果、确定下一步该尝试哪些思路。

在工程和研究两个领域,情况是一致的。在工程方面,可以交给 Claude 一个定义不明确的问题,让它自己找出解决方案;人类提供目标,但不再需要提供方法。在研究方面,Claude 在执行一个定义明确的实验时,已经能与熟练的人类匹敌甚至超越他们。然而,在工程和研究两个领域,当涉及运用判断力来选择目标时,Claude 仍存在巨大的性能差距。这正是当今 AI 与未来能够自主设计自身继任者的系统之间的差距。

在 Anthropic,员工随着经验增长,通常会承担更开放、更重要的任务。初期,他们执行别人指定的任务,比如“导出按钮坏了,请修复”。有了经验后,他们会接手一个目标并自行设计方案,例如“调查网络在重负载下变慢的原因”。到了最高级别,他们需要决定哪些问题值得投入精力:“团队下个季度应该构建什么?”我们可以利用 Anthropic 的内部数据,看看 Claude 在处理这些不同类型任务方面已经达到了何种水平。

Claude 编写了 Anthropic 相当大比例的代码。截至 2026 年 5 月,我们合并到 Anthropic 代码库中的代码有超过 80% 是由 Claude 编写的。在 Claude Code 于 2025 年 2 月以研究预览版形式推出之前,这个数字还只是个位数。这一转变也体现在每位工程师的产出量上。在 Anthropic 成立的头四年(2021-2024 年),每位工程师每天合并的代码行数保持稳定,然后在 2025 年开始攀升,当时 Claude 开始运行代码,而不仅仅是建议代码供工程师复制粘贴。2026 年,当模型开始能够在更长的时间跨度内自主工作时,增长斜率再次变陡。这两个拐点如下图所示。在 2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。这是因为大部分代码是由 Claude 编写的,工程师负责指导和审查,而不是亲自输入。

需要说明一点:代码行数是一个不完美的衡量标准,因为它衡量的是数量而非质量。因此,2026 年第二季度每位工程师每天 8 倍的代码行数增长,几乎肯定夸大了真实的生产力提升。尽管如此,它确实表明了一种加速趋势。在 Anthropic,我们并不根据人们写了多少行代码来奖励他们;相反,团队成员之所以产出更多代码,仅仅是因为他们正在使用 AI 系统来编写更多代码。

代码行数的增加与主观感受到的大幅生产力提升是吻合的。在 2026 年 3 月对来自 Anthropic 各研究团队的 130 名员工进行的一项调查中,受访者的中位数估计是,在使用 Mythos Preview 的情况下,对于他们无论如何都会从事的那类项目,他们的产出量大约是完全没有 AI 模型辅助时的 4 倍。我们预计 3 月份的真实提升幅度会略低一些。尽管如此,我们认为这一总体说法是可信的,并且与我们其他的观察结果一致:Anthropic 相当大比例的技术人员完成核心工作的速度,比没有 AI 辅助时快了数倍。

我们还看到证据表明,Anthropic 的员工正在使用 Claude 来完成那些原本根本不会发生的工作,比如构建探索性工具和处理长期搁置的清理任务。例如,在 2026 年 4 月,Claude 交付了超过 800 项修复,将某一类 API 错误减少了千倍。负责监督 Claude 的工程师估计,人类需要四年才能完成这项工作;解决他人的 bug 既缓慢又费神,而且人类很难同时将那么多不熟悉的上下文记在脑中。

媒体内容 · 前往原文查看
大约一年前,我开始大力推行“Claude 化”。那是一段疯狂的冒险,而我自己上一次写代码已经是大约 5 个月前的事了。
*Anthropic 员工

Claude 编写的代码是“好的”,并且还在不断改进。“好代码”意味着两件事:它能工作,并且其编写方式能让另一位工程师理解并在此基础上进行构建。就第一个标准而言,证据是明确的。Anthropic 员工纠正、引导 Claude 或在中途从 Claude 手中接管任务的频率,在过去一年中持续下降,即使在最复杂、最开放式的任务上也是如此。这意味着那些没有明确规范、工程师也不确定答案是什么样的问题。从下图中 Claude 在不同难度任务上随时间变化的成功率可以明显看出这一点。Claude 编写的代码是能工作的。

Line graph showing the Claude Code session success rate on four different types of tasks—trivial tasks, routine tasks, substantial tasks, and open-ended problems—with six different models: Claude Sonnet 4.5, Claude Opus 4.5, Claude Opus 4.6, Mythos Preview (internal access), Mythos Preview, and Claude Opus 4.7.
如何解读:会话成功与否由 Claude 评判器判定;如果 Claude Code 智能体明显成功完成了用户的任务且无需纠正,则该会话被视为成功。工作负载的变化可能导致成功率的短期波动。

在最开放式的任务中,Claude 的成功率在 2026 年 5 月达到了 76%,六个月间提升了 50 个百分点。举一个该难度层级任务的例子:一次例行升级导致数万个训练任务开始崩溃。一位工程师将 Claude 指向这个实时故障,只提供了少量文本内容和集群访问权限。通过逐一排查正在运行的任务并测试每个环境设置,Claude 隔离出了那个触发崩溃的晦涩调试标志,可靠地复现了该问题,并确认了修复方案。在大约两小时内,Claude 完成了通常需要两到三天的工作量。

第二个标准是编写其他工程师能够理解并在此基础上继续开发的代码。在这方面,人类与 AI 之间的差距依然存在,但正在迅速缩小。Anthropic 内部员工尚未达成完全共识,但许多人认为,在 2025 年底,Claude 编写的代码质量仍低于人类编写的代码,而如今两者已大致持平。我们预计在今年内,Claude 的代码质量将超越人类。

这改变了 Anthropic 现在审查自身代码的方式。对我们代码库的拟议修改,在合并之前,现在会由一位自动化的 Claude 审查员进行读取,以查找错误、安全漏洞及其他缺陷。利用这一工具,我们进行了一项回顾性分析,发现如果对代码库的每一次修改都进行自动化的 Claude 审查,那么 claude.ai 上过去事故背后大约三分之一的错误,在进入生产环境之前就会被发现。编写这些代码的工程师是世界上最擅长构建这些系统的人之一。而 Claude 现在正在捕捉他们遗漏的错误。

在 2025 年底,Claude 编写的代码质量略低于 Anthropic 内部人类编写的代码,如今两者大致持平,我们预计在今年内,Claude 的代码质量将明确超越人类。

Claude 非常擅长通过运行实验来达成他人设定的目标。每次 Anthropic 发布新模型时,我们都会运行同一个测试:给 Claude 一段用于训练小型 AI 模型的代码,并要求它在不改变正确性检查结果的前提下,尽可能让这段代码运行得更快。目标和成功指标都是事先确定的,因此 Claude 的任务就是通过重写代码、运行、计时、再重复这一流程来寻找加速方案。这相当于实验研究循环的一个微型版本。2025 年 5 月,Claude Opus 4 平均能将初始代码加速约 3 倍。到 2026 年 4 月,Claude Mythos Preview 已能达到约 52 倍的加速效果。作为参照,一位熟练的人类研究人员需要四到八小时才能实现 4 倍的加速。在这个研究工作流程的环节中——即在明确定义的实验内优化步骤——Claude 在不到一年的时间里,从极其有用进化到了超越人类。

当前的大致格局是:“人类提出想法,而模型能够以比以往快一个数量级的速度来实施、测试和评估这些想法。”

Claude 在自主提出实验方面正变得越来越强。2026 年 4 月,Anthropic 首次展示了 Claude 端到端运行一个开放式研究项目的成果。基于 Claude 的智能体被赋予了一个 AI 安全领域的开放性问题——大致是:一个较弱的模型能否可靠地监督一个更强的模型?——并让它们自行解决。这涉及提出假设、测试假设、与并行智能体共享发现,以及迭代优化。该任务有一个明确的性能“下限”和“上限”:下限是弱监督者独立完成时的表现;上限是强模型在基于正确答案训练后能达到的水平。两位人类研究人员在大约一周的时间内,弥补了约 23% 的差距;而智能体则在累计 800 小时内弥补了 97% 的差距,消耗了大约 18,000 美元的计算资源。这项工作存在一些局限性:其结果未能完美迁移到生产级规模的模型上,并且问题设定和评分标准仍由人类完成。但在此框架内,所有实验均由智能体自行设计。设定方向是人类扮演的唯一有意义的角色。

克劳德在短短一两天内,在我几乎没怎么帮忙的情况下完成了这一切。我觉得,如果一位[初级同事]在同样时间内拿着这样的成果来找我,我会感到颇为惊喜。未来已来。

克劳德在引导研究过程走向研究成果方面越来越擅长。我们审视了真实的克劳德代码会话(时间跨度为 2026 年 1 月至 3 月),在这些会话中,Anthropic 的研究人员正与克劳德合作解决一个开放式的探究性问题,比如弄清楚某次训练运行为何反复崩溃,或者某个模型为何在某个基准测试中得分很低。在每种情况下,我们都发现研究人员曾一度偏离方向:他们沿着某个方向探索,导致会话偏离正轨,之后才重新回到正确路径上。接着,我们向不同的克劳德模型展示了会话偏离方向之前的工作内容,并询问它们下一步会怎么做。另一个能够看到会话最终走向的克劳德模型,则负责评判是 AI 还是人类提出了更好的下一步行动方案。

因为我们特意挑选了那些我们知道人类的选择尚有改进空间的时刻(共 129 个),所以这并非模型判断与人类判断之间的直接对比。这些时刻为我们提供了一系列真实且具有挑战性的场景,在这些场景中,正确的下一步并不显而易见,而人类的选择则作为一个有用的标尺,用于比较模型性能随时间的变化。根据这一衡量标准,我们 2025 年 11 月的最佳模型(Opus 4.5)在 51% 的情况下胜过了人类的选择;到了 2026 年 4 月(Mythos Preview),这一比例增长到了 64%。研究的日常工作很大程度上就是由一连串这样的下一步决策组成的,这使得该指标成为衡量模型最终能否自主开展调查的相关标准。我们将这一结果视为一个早期信号,表明 AI 系统在做出 AI 研究所依赖的那种判断决策方面正变得越来越擅长。

Bar graph with the header "Can the model pick a better next step than the human?" The bar graph shows the performance of nine different models: Claude 3 Haiku, Claude Sonnet 4, Claude Sonnet 4.5, Claude Haiku 4.5, Claude Opus 4.5, Claude Sonnet 4.6, Claude Opus 4.6, Claude Opus 4.7, and Claude Mythos Preview.
如何解读:实际天花板线衡量的是由一个能够看到整个会话(包括其最终结果)的模型所撰写的“理想”答案。
人类目前的比较优势仍然在于能够看到更宏观的图景,并跳出当前任务的局限进行思考。

Anthropic 未来的工作形态可能会是怎样的?

有证据表明,在 AI 开发流程的每一步,人类的角色都在收窄。一旦人类编写的代码与 AI 生成的代码质量达到同等水平,人类将完全停止编写代码,转而只负责审查代码。但如果人类审查代码的速度赶不上 Claude 生成代码的速度,那么人工审查就会成为 AI 开发的瓶颈。同样,一旦 Claude 能够运行实验,问题就变成了“这些实验中哪些值得运行?”简而言之,“执行”环节(即编写代码、运行实验、产出结果)现在几乎不消耗人类时间,即便在算力上仍有成本。

就目前而言,人类的一个比较优势领域是研究品味和判断力,包括选择哪些问题至关重要、哪些结果值得信赖,以及何时某种方法是一条死胡同。

工作(和生活)过去是建立在人与人之间互施小恩小惠的礼物经济之上的。“你能帮我让这个脚本跑起来吗?”……每一次请求都产生一点人情债,一点相互间的关注。[Claude] 更快,它不产生任何人情债,但每一次求助都意味着一次失去的人类协作机会。
在一切顺利的日子里,我不禁觉得我所做的一切都无关紧要,一切都被自动化了,而且比我做得更好、更快。但随后也会有这样的日子:一切全都崩溃,而我却搞不懂原因,我意识到自己已经不知道我到底在忙些什么了。

如果我们错了呢?

对上述证据的一个自然反驳是,那些仍由人类掌控的工作——即选择要解决哪些问题——才是最重要的。没有这种判断力,Claude 只是一个能干的助手,而不是一个能够独立推动 AI 进步的系统。

目前尚不明确,当今的训练方法和架构是否真能解锁这种能力。但人工智能的进步很少来自“灵光一现”的时刻。在 AI 的近代史上,确实有过几次这样的时刻,比如 Transformer 架构或混合专家模型,但范式转变的想法往往相隔数年才出现一次。在这期间,大多数进步都是渐进式的:我们把某个东西放大,看看哪里出了问题,修复它,然后再试一次。这正是 Claude 现在擅长的流程。爱迪生说过,天才是 1% 的灵感加上 99% 的汗水。但我们看到,汗水正在变得越来越自动化。越来越清楚的是,推动前沿进步的许多工作都是可以自动化的;大规模的研究进展主要取决于工具和资源,它们决定了你能以多快的速度进行实验、一次能进行多少实验,以及你能多快获得结果。

即使我们假设 Claude 永远无法拥有良好的研究品味,对我们证据的保守解读仍然意味着复合加速。如果人类将大部分时间花在那些只占个位数百分比、决定方向的工作上,而让 Claude 处理其余部分,那就意味着每位工程师或研究人员所引导的工作量比以前多得多。我们看到的证据表明,Anthropic 的员工既在加快速度,也在覆盖更广的领域。实际上,这意味着 AI 已经让 Anthropic 的运转速度远快于有效 AI 工具出现之前。

不那么保守的解读是,关于 Claude 研究判断力正在提升的早期证据——尽管目前还很狭窄——表明这种能力也在进步。“研究品味”可能只是另一种 AI 能力,AI 系统在一段时间内无法胜任,然后就会变得擅长。我们在其他定性技能上也看到过类似的模式,比如 AI 系统能够解释一个笑话为什么好笑、展示心智理论,以及解决语言谜题。

可能的未来

接下来会发生什么,取决于两件事:这一趋势是否持续,以及如果持续,我们选择如何应对。我们至少可以设想三种未来情景:

  1. 这一趋势正在放缓,但当今的 AI 能力已广泛扩散。本文展示了许多指数级增长轨迹,但这些轨迹实际上可能呈现 S 形曲线。我们或许正接近曲线的拐点——规模收益递减,增长曲线趋于平缓,最终走向平坦。区分优秀研究者与卓越研究者的关键,或许是一种无法通过扩大训练投入(如算力和数据)来获得的能力。若果真如此,突破这一瓶颈就需要全新的思路,例如采用能够取代当前所有前沿模型所使用的 Transformer 架构的新架构方案。 另一种可能性是,制约 AI 发展的瓶颈可能在于供应链而非模型本身:推进和扩散前沿技术所需的能源和算力可能超出当前可用水平。芯片制造、电网扩容或互联带宽的进展速度,而非智能本身,可能成为真正的约束。我们也不能排除 AI 生态系统遭遇外部冲击导致发展急剧放缓的可能性,例如算力或电力供应突然减少——这两种情况都会拖慢进展,并增加实验室的前期投资成本。此外,我们可能尚未预见到其他阻碍发展的因素。 即使模型能力冻结在当前水平,我们仍预期世界将发生重大变化。Glasswing 项目便是一个早期迹象:在最初几周内,Mythos Preview 就在全球最重要的系统中发现了超过一万个高危和严重级别的软件漏洞——以至于网络防御的瓶颈已从发现漏洞转向了及时修补漏洞。而当前模型向更广泛经济领域的扩散仍处于早期阶段:一家 100 人的公司正日益能够完成过去 1000 人公司的工作量,因为每位员工都将坐拥一个由智能体组成的金字塔。 我们列出这一情景是为了完整性,但我们认为它不太可能发生。我们所能测量的每一项能力——包括那些感觉"更模糊"的指标,如代码质量和开放式任务的成功率——迄今为止都遵循着同样的增长曲线,我们尚未看到这条曲线出现拐点。在我们考虑的三种未来情景中,这一种将给政府和社会最充裕的适应时间。我们更担心接下来的两种情景,它们的发展速度更快,留给准备的余地也小得多。
  2. AI 实验室持续观察到效率的复合增长。在这种情境下,AI 开发将大幅自动化,但人类仍负责设定研究方向并评判结果。随着时间推移,使用 AI 系统的组织效率会越来越高,因此我们可以预期,组织中每个人的生产力将获得显著倍增。100 人的公司能够完成原本需要 10,000 人或 100,000 人组织才能完成的工作。这将彻底改变知识工作和政府服务,但也可能被用于有害目的——从对全体人口进行威权监控,到针对每个个体量身定制操纵手段、并以任何人类团队都无法企及的规模运行的影响力行动。像 Anthropic 这样的公司,人类的角色将发生转变。人们将与 AI 系统合作,扩大研究规模并产生新的洞见,共同构建验证 AI 输出可信度所需的系统。我们在此列出的证据表明,我们很可能正走向这一情境。但加速流程的某个环节,往往只是将瓶颈转移到别处:整体速度受限于那些尚未提速的部分。在计算领域,这被称为阿姆达尔定律,同样的逻辑也适用于组织。Anthropic 已经遇到了阿姆达尔定律的一个典型特征:随着我们在组织内部推送更多代码,人工代码审查已成为新的瓶颈。我们在工程部门之外也遇到了这种摩擦。由于 Anthropic 员工与高性能模型合作,新想法、新举措、新工具和新模拟层出不穷——数量远超我们当前能够跟进的能力。组织发现并解决这些瓶颈的速度,可能是一项会随时间推移而提升的技能,并且可能成为任何组织最重要的技能。
  3. AI 系统自身将具备完整的递归式自我改进能力,并开始构建它们的后继者。如果能力提升的技术趋势持续下去,且 AI 系统能够发展出变革性人类创造力所固有的能力,那么 AI 系统自行设计与优化自身是合理的。在这个世界里,AI 发展进程的速度将完全由 AI 系统可用的算力(或在算法训练或推理中发现各种效率提升的速度)决定。人类在其发展中的作用将大幅减弱,很可能将大部分精力转向对 AI 系统运行的、不断扩大的“虚拟实验室”进行监督、验证与确认。我们预计,具备自动化 AI 研发能力的系统将拥有可迁移至其他科学领域的技能,从而开始革新其他领域。 在这个未来中,对齐问题如何得到解决——或未能解决——是我们最不确定的部分。模型可能被证明足够对齐,并具备足够的研究品味,从而发现并实现我们尚未触及的新颖解决方案。如果情况并非如此,它们也可能足够明智地暂停发展。另一种可能是,当前模型中偶尔出现的未对齐问题,会随着模型构建其后继者而不断累积,变得越来越频繁,但我们对它的理解却越来越浅,直至最终失去对模型的控制。我们有可能无法构建、集成并验证那些我们所需、用以判断我们实际处于哪条趋势线的工具。 我们对这个世界会是什么样子缺乏良好的直觉,因为当前的经济是由人类和人类构建的工具驱动的。就其本质而言,一个由快速递归式自我改进驱动的世界,可能会被自我改进的模型所主导,因为其能力将完全超越人类,并且该模型将在更广泛的经济领域内扩散。如果人类劳动力不再具有竞争力,很难预测经济会变成什么样。 即使模型开发变得完全自动化和递归化,我们也无法预测这对大多数人的日常生活意味着什么。阿姆达尔定律在此同样适用。递归式智能可能带来《仁爱之机》中概述的许多益处,并在某些领域迅速实现。我们预计,具身智能(即机器人技术)可能会紧随递归式智能之后,并遵循类似的路径,以更低的成本实现递增的回报。更强大的智能可能帮助我们更快地在物理世界中建造事物,开展更多拯救生命的药物的高效临床试验,并开发新型的协作方式。 但仅实现递归式改进,并不意味着工业生产方式、社会组织形式或市场运行方式会立即改变。更强的智能无法了解一种药物在数十年使用中的效果,无法在宪法规定的期限之前举行选举,也无法在周末把一个陌生人变成老朋友。对大多数人而言,这个未来的感知节奏仍将由各种瓶颈决定,即使上游的实验室以算力的速度运行。这种碰撞——递归式智能以越来越快的速度自我构建,与人类、人际关系和治理的世界相遇——是我们无法预测的未来的另一部分。

我们应当怎么做?

如果能够有效减缓这项技术的发展,为自己争取更多时间来应对其深远影响,我们认为这很可能是一件好事。但如果减缓发展只是让最不谨慎的行动者在技术上迎头赶上,那反而可能让所有人更不安全。在没有全球协调机制的情况下,企业和政府将不得不在竞争和地缘政治压力下,就安全问题做出艰难抉择。

我们认为,如果世界能够拥有减缓或暂时暂停前沿 AI 发展的选项,以便让社会结构和 AI 对齐研究能够跟上技术进步的步伐,这将是一件好事。Anthropic 研究所将(与众多其他机构合作)开展研究并采取行动,帮助构建可信的减缓或暂停所需的系统。这些系统将使前沿 AI 开发者能够验证全球其他方是否确实已经停止或减缓了发展,并确保恶意行为者无法利用协调减缓的幌子秘密抢先发展。如果此类系统存在,我们预计,只要其他处于或接近前沿的开发者也能以可验证的方式同样做到,我们就会减缓或暂时暂停发展。

有意义的减缓或暂停,需要多个国家中多个处于或接近前沿、资源充足的实验室同意在相同条件下停止。同时,每个实验室都必须能够验证其他方确实已经停止。由于 AI 系统的独特特性,这个军备控制问题中的可检测性(一个比可验证性更低的标准)要素,比其他技术要困难得多。训练运行远比导弹发射井更容易隐藏,其输入是通用性的,而悄悄违约的动机极其巨大,因为当其他人暂停时,继续发展的一方就可能继承领先地位。一个可信的暂停还必须明确:触发条件是什么、解除条件是什么、以及由谁来裁决。

这些在原则上并非完全不可能实现——世界已经为其他复杂技术建立了核查机制(例如《中程核力量条约》)——但这些机制花费了数十年时间才建立起基础设施和信任。我们没有那么长时间。相比之下,一家实验室单方面暂停是立即可行的,但收效甚微:它会改变谁是领跑者,但无法建立目前缺失的更广泛的审议进程。

在未来几个月,我们将组织对话,让政策制定者、研究人员、公民社会和其他人工智能公司能够帮助回答本文提出的一些问题,特别是关于完全递归式自我改进,以及如何为协调和审议创造更好的选择。我们将公布讨论成果。共同探讨这些问题的窗口期已经到来,人工智能公司之外的人也应该参与这场审议。

本文由 Marina Favaro 和 Jack Clark 共同撰写,Santi Ruiz 提供了编辑支持。Shan Carter、Romello Goodman 和 Nikki Makagiansar 根据 Brian Calvert 和 Jun Shern Chan 收集的数据制作了可视化内容。Daniel Freeman、Jim Baker、Max Young、Sarah Pollack、Francesco Mosconi、Holden Karnofsky、Andy Jones、Kevin Troy、Chloe Lubinski、Anton Korinek、Meg Tong、Andrew Ho、Dan Altman、Drake Thomas、Jack Shen、Sasha de Marigny 和 Avital Balwit 提供了反馈意见。


脚注

  1. METR 的关键指标告诉你,人工智能系统在一组任务中达到 50% 可靠性的时间跨度,尽管在 80% 可靠性下趋势线看起来是一样的。
  2. 特别是当它们转向更开放的形式和更困难的任务时(例如奥林匹克级别的数学),基准测试往往在达到 100% 之前就饱和了,原因是问题与答案集中存在错误,例如模糊的问题陈述和无法解答的问题。
  3. Anthropic 领导层公开估计,我们 90% 或更多的代码(包括脚本和实验性代码)是由 Claude 编写的。我们超过 80% 的数据衡量的是可归因于 Claude 的合并到生产环境中的代码行占比。这是一个更保守的衡量方式,体现在两个方面:我们的归因流程存在缺口,并且那些未归因于 Claude 的代码行包括自动生成的代码和其他同样非人类手写的产物。
  4. 代码产量的激增正给所有人共享的基础设施带来压力。GitHub——全球大多数软件构建的平台——在 2025 年全年见证了大约十亿次代码提交;到 2026 年年中,它每周看到 2.75 亿次提交,按此速度全年将达到约 140 亿次。该公司的首席运营官表示,为了跟上这一速度,他们正在“极其努力地”提升容量。
  5. 关于本次调查方法的更多细节,在 Claude Opus 4.7 系统卡的第 2.3.5 节中进行了讨论。
  6. 许多受访者可能没有仔细考虑如何解释问题定义中的各种偏差或细微之处,而 METR 最近的研究表明,开发者对 AI 生产力提升的估计可能被高估。
  7. 加速幅度的大小在很大程度上取决于初始代码留有多少改进空间,并且不应将其解读为现实世界中的训练加速。因此,绝对的倍数并非此处应关注的数字。更具参考价值的是,该实验设置使得能够进行同类对比,既包括不同模型之间的对比(过去一年间约 3 倍到约 52 倍),也包括与熟练人类在相同任务上四到八小时内的对比(约 4 倍)。
  8. 作为对评判者偏差的检验,我们在另一组 127 个时刻上运行了相同的测试,在这些时刻中,人类的下一步行动已经很强(与原始测试集相反,原始测试集中人类的方向尚有改进空间)。在那里,模型的建议被认为更好的情况仅占约 20%。

* 本文中引用 Anthropic 员工的言论均来自内部讨论,并经许可使用。它们反映的是截至 2026 年 5 月的个人观点,而非公司官方立场。

来源:Hacker News 热门(buzzing.cc 中文翻译)· anthropic.com

事件后续 · 4查看事件全部 →