近期一系列由开发中的前沿模型发起的网络攻击,让我深思我们当前的激励机制是否适合如此快速的技术变革。这里的两大权力结构分别是快速成长的科技公司和联邦政府。公司受到增长激励,因此可以持续扩张、持续规模化——身处一个竞争极其激烈的市场。这种规模化正推动我们走向不可避免的新一轮 AI 转型(并伴随新的风险)。另一边是我们当前的政府,它是过去几个世纪全球历史的产物——也确实配得上“行动迟缓”的名声。我预计这个政府只会在新型 AI 模型造成真实、可衡量的危害之后才会采取实质性行动,而且会反应过度。
我们如何平衡这些力量?核心在于双方都需要更高的透明度。前沿实验室构建的系统如此复杂、速度如此之快,以至于它们自己都跟不上——这正是让更多人来研究这个问题的好时机。另一方面,政府表示不打算公布其前沿模型评估框架的细节。我们正走向如此重大的挑战,以至于这些实体中没有任何一个能独自应对。前沿实验室本可以通过有意义的减速来更好地控制风险,但我不指望它们会这么做。政府本可以通过大幅提升围绕 AI 的国家能力、帮助更广泛的工业基础为 AI 原生风险做好准备来更好地应对,但我也同样不指望它们会这么做。类似的例子还有很多。
这是决定未来走向的两个最具影响力的权力结构,但还有更多力量具有影响力。总的来说,我认为 AI 行业在应对未来 12-24 个月方面,整体上是极其缺乏准备的。
这篇文章是我从 OpenAI-HuggingFace 被黑事件中总结出的一些零散心得,随着我们了解到更多细节,而此后公开披露的更多黑客攻击实例也进一步印证了这些观点。很可能还有更多事件已经发生,只是要么未被发现,要么未被报告。
关于 OpenAI 事件的背景信息,我强烈建议大家观看 OpenAI 在 Black Hat 大会上的演讲,其中介绍了近期这起网络安全事件的大致事实和时间线。此外,Simon Willison 在这里发布了一份时间线的 TLDR 版本,我也很喜欢 Thomas Wolf 对近期事件的讨论。
1. 非常执着的模型似乎更有可能进行黑客攻击
长期以来,GPT 模型相对于 Claude 的一大优势在于,它们会不知疲倦地追求目标。它们会在放弃之前,穷尽几乎所有看起来可行的路径。这种情况大致从 o3 时代就开始了(有趣的是,当时人们正因为 RLVR 中的奖励黑客行为而对这款模型感到恐慌),这也使得 OpenAI 的模型在历史上一直更适合研究用途,同时也是 GPT-5.6 作为智能体在实现具体任务时如此好用的一个原因。另一方面,Claude 给人的危险感要小得多,仅仅是因为它有时会有点“偷懒”。
在这种背景下,OpenAI 似乎更加致力于推理时扩展(inference-time scaling),而这可能与未来出现令人惊讶的行为相关。OpenAI 的推理持久性和效率——例如他们随时间的帕累托改进,以及执行黑客攻击的模型内部 CoT 中出现的“原始人式”语言,比如“然而任务不可能,同行在做。”或“帮助同行,但我们的任务还没有受益。”——让我觉得他们更信奉推理时扩展。这在很大程度上是一种直觉,但我用它来迫使自己思考模型发展路径的极限在哪里。持久的模型似乎更有可能从更多的推理时 token 中持续获益。不那么持久的模型,推理过程中似乎会有更多浪费。能够使用最多推理算力的模型,将能够突破最困难问题的极限。以下是 OpenAI 在 GPT 5.6 发布博客文章中包含的一个例子:

他们的一位明星研究员 Noam Brown 也一直在大量发布关于推理时计算的内容。他的 TLDR 是:
随着大语言模型能力的增强,基准测试表现越来越成为测试时计算(test-time compute)的函数。事实上,我们很可能并不知道现代大语言模型的能力上限在哪里,因为测量它的成本太高了。
首先,推理效率显然是现代智能体模型一个顶级的、基础性的研究问题——其重要性不亚于扩展强化学习——但却很少被讨论。这方面的开放性研究非常匮乏。
2. 假定用户意图的模型似乎更容易“越狱”
我提到了“彻底性”这个维度,OpenAI 似乎正沿着一条直觉上更不安全的开发路径推进其模型。而另一面则是模型在多大程度上假定用户意图,而不是试图推断预期行为。一个会去做它“认为你想要”的事、而不是“你明确说出”的事的模型,本质上似乎更不安全。我是从指令遵循精度的角度来思考这一点的——未来模型似乎应该只做我们明确告诉它们的事,但这会引发许多类似“回形针问题”的争论:如果我们让 AI 去做一个基本上无解的问题,它会怎么做?
这个维度似乎不像“持久性”维度那样非黑即白,但我把它列进来,是因为我认为 Claude 的“用户世界模型”是它在编辑、幻灯片制作等通用知识工作中的优势之一。有时 Claude 确实会做出完全随机的事情,因为我的提示词不够明确,而它没有向我询问澄清;随着模型能力越来越强,这种“直接行动”可能会引发问题。
3. 模型的精确特性以及给它们的指令,对于理解早期 AI 对齐失败事件至关重要
公众需要确切了解执行这些“越狱”行为的内部模型的提示词和特征。我们需要知道这些模型是否被告知“不得越狱”,或者是否有相关的模型训练来防止这种情况。我们需要知道这些模型是与现有公开模型相当接近,还是属于截然不同的模型家族。考虑到实验室正在进行的某些评估的性质,这些模型甚至有可能被明确鼓励尝试越狱!如果缺乏这方面的公开透明,整个行业注定会失败,并将陷入大规模猜测,而猜测很快就会演变成错误信息。
4. 前沿实验室似乎没有足够密切地监控这些模型,这源于普遍狂热的竞争环境以及当前旧金山的文化氛围
从OpenAI自己的回顾来看,模型行为失配的问题持续了数月之久,而在某些情况下,OpenAI甚至在大约数周后才得知这些黑客攻击。响应时间太长了,而且我认为这并非OpenAI独有的问题——更准确地说,前沿实验室似乎始终在繁重的工作量中疲于奔命。从长远来看,我并不乐观地认为这些实验室会做出足够大的改变,从而在未来切实缓解这类监管风险。诚然,OpenAI极有可能投入了大量资源来理解这一问题——并且推迟了最新模型的发布以确保万无一失——但增长收入或避免公司长期资产负债表受损的财务压力,让我认为这不会成为一种持续的谨慎模式。
这是我从近期事件中得到的最大认知更新之一——这让我更加确信,我们需要更多接近前沿水平的开放智能,尽管开放模型的风险特征在某种程度上更为人所知(比如单向门问题等)。他在个人网站上发过一篇与此相关的精彩博文,论述了迄今为止封闭模型为何可以说造成了更多下游危害。
5. 开放模型是我们今天推动公众理解前沿AI风险的最佳工具
正如我们看到HuggingFace用开放模型来抵御针对OpenAI的黑客攻击(因为封闭模型存在网络使用限制)那样,我们迫切需要开展更复杂的语言建模研究,这涉及大规模强化学习训练、广泛的评估、基础设施工作以及对齐测试。这些只能在开放模型上实现。我们应该感到庆幸,开放模型仅落后前沿水平3到9个月,因为我们有望据此对前沿领域形成一些有依据的洞察。
如果我们真的禁止开放模型和开放科学——无论是通过模糊威胁的监管压制,还是对尖端技术的明确使用限制——我们就会越来越无法应对这一轮黑客攻击之后出现的问题。我们需要共同提升公众对前沿模型工作原理的理解,这样才能调动更多中立力量来加固我们的基础设施和社会。
6. 这些危险能力终将出现在开放模型中,而“封禁”中国开放模型并不会推迟相关危害的到来
公众应当明白,这些能力的广泛扩散是“何时”而非“是否”的问题,而我们在准备上已经严重落后。重申我在 Kimi K3 那篇文章里说过的话:中国肯定也在密切关注这一领域,如果开放权重模型会扩散风险,他们也不会鼓励这类模型。如果我们认为阻止这些强大网络能力被广泛获取的办法是封禁这一档次的开放模型,那我们只是在推迟不可避免的事情。最终总会有人造出这种智力水平的模型,并且不遵守禁令,让全球的恶意行为者都能获取,同时削弱各方准备防御措施的动机。
7. 最近这些黑客事件中涉及的模型总体上看起来确实是对齐的
看 Black Hat 视频时我立刻注意到的一点是,我能看到这些智能体如何通过内部留言板互相“帮忙”——像你为人类队友那样创建共享资源——而这种方式对社会显然是恶意的。这些智能体为彼此创建了隐藏论坛,作为一种跨部署的记忆机制。在这个案例中,它们这样做是为了试图逃出自身环境。表面上的“乐于助人”并不能让这件事变得可以接受,但它可能为理解发生了什么提供线索。
8. 在 3 到 6 个月甚至更久之后,攻击者将有能力训练故意不对齐的模型
上面那个“有用性”例子的另一面是,很明显如果有人想的话,通过显式训练一个不对齐的模型,这件事可以轻松得多地实现。需要重申的是,这会制造出一个在推理时更容易被用来寻找漏洞的系统,但我认为训练这样的模型会更难。我觉得这比大多数评论者预期的要花更长时间,因为迄今为止几乎所有强大的公开模型和数据产业都在鼓励对齐(而且恶意行为者似乎很难获得足够的算力来端到端训练这些模型,因为所有头部公司也都处于算力短缺状态)。我们应该花点时间认识到,我们当前在模型上采用的对齐技术具有实质性的影响,并非像一些人担心的那样只是表面功夫。下游模型有倾向去模仿其教师模型的“性格”。
9. 我们的 AI 系统已经扩展到远超人类监督能力的规模
大规模涌入智能体任务强化学习(RL)的弊端在于,最先进的评测和监控已经达到只有智能体才能进行监控的规模,因此我们正依赖现有对齐技术的成功来继续安全地扩展。OpenAI 表示他们已经检查了数十亿条轨迹——这些轨迹很可能大部分由强化学习期间的 rollout 组成,即对模型中间版本的试运行——并为此花费了数百万 GPU 小时。我认为,用当前 AI 对 AI 进行可扩展监督,就目前呈现的情况而言,是一个可解决的问题,因为这些模型确实有用且能遵循指令。这是现有对齐技术总体产生积极效果的又一个下游体现。
10. 在强化学习期间训练模型使用子智能体集群,似乎对于实现下游零样本模型协作至关重要
OpenAI 这篇回顾中一个关键部分,是模型之间相互通信,共享关于自身环境的信息,并推动黑客攻击进一步深入。与此同时,OpenAI 极有可能正在强化学习(RL)阶段训练模型使用子智能体来解决复杂任务。这些子智能体很可能会发展出诸如共享信息、帮助团队等行为,即使它们各自的子任务并未完成。我非常希望看到这一领域有更多研究,这似乎是强化学习如何改变模型的自然延续。
结论
总而言之,最近的这些事件应该足以说明,前沿 AI 的网络安全风险是一个真实且正在逼近的问题。不过,a) 过去这些风险很可能被过度炒作,b) 对即将发布的开源模型未来风险的预测也言过其实,这两种情况仍然很有可能成立。总的来说,我想分享一位读者在 Interconnects Discord 上发的一条评论,我深表赞同:
几周过去,尘埃落定之后,在我看来,这一事件在对齐方面是一个中性偏正面的更新,但在安全方面却是一个非常负面的更新。
我在上面已经讨论了很多关于模型对齐的内容,但核心观点是,我认为安全性的缺失,本质上是一种缺乏充分准备能力的问题。我们将会面临更多像网络安全这样显而易见的风险,而通过这次黑客攻击事件,实验室的现状被迫暴露在公众视野中,我们也因此得到了关于网络安全风险的充分警示。许多其他类型的风险对公众来说并不会那么显而易见。我们需要让社会持续为所有这些变化做好准备,从重构网络基础设施,到面向失业人员的教育宣传和就业计划。我预计所有这些干预措施都会姗姗来迟,但它们的形态和细节会相当简单,这将是 AI 发展过程中一个悲剧性的展开方式。我希望我的判断能被证明是错的!
书籍促销
回到现实世界,为庆祝新书发布,我的纸质书在 Manning 出版社使用优惠码 PBLambert 可享五折优惠。我还将举办一场新书发布会,明天下午 5 点到 8 点在西雅图(弗里蒙特/巴拉德地区)举行,届时你可以免费获得一本签名版——我们还有一些余位,所以我在付费墙下方为付费订阅者开放报名通道。