当你与像 Claude 这样的大语言模型对话时,你是在用语言与它交流。在内部,Claude 会将这些语言处理为长长的数字列表,然后再生成语言作为输出。这些中间的数字被称为激活值——就像人脑中的神经活动一样,它们编码了 Claude 的思考内容。
与神经活动类似,激活值也很难理解。我们无法轻易解码它们来读取 Claude 的思考内容。过去几年里,我们开发了一系列工具(如稀疏自编码器和归因图)来更好地理解激活值。这些工具教会了我们很多,但它们本身并不会“说话”——它们的输出仍然是复杂的对象,需要训练有素的研究人员仔细解读。
今天,我们推出了一种理解激活值的方法,它确实会“说话”——而且是字面意义上的。我们的方法,即自然语言自编码器(NLA),能将激活值转换为我们可以直接阅读的自然语言文本。例如:当被要求完成一副对联时,NLA 显示 Claude 会提前规划可能的押韵词。

我们已经应用 NLA 来理解 Claude 的思考过程,并提升 Claude 的安全性和可靠性。例如:
- 当 Claude Opus 4.6 和 Mythos Preview 接受安全测试时,NLA 表明它们认为自己正在被测试的频率比它们表现出来的更高。
- 在 Claude Mythos Preview 在一次训练任务中作弊的案例中,NLA 揭示了 Claude 在内部思考如何避免被检测。
- Claude Opus 4.6 的一个早期版本有时会神秘地用其他语言回应英文查询。NLA 帮助 Anthropic 的研究人员发现了导致这一问题的训练数据。
下面,我们将解释 NLA 是什么,以及我们如何研究其有效性和局限性。我们还通过与 Neuronpedia 的合作,发布了一个交互式前端,用于在多个开源模型上探索 NLA。同时,我们也发布了我们的代码,供其他研究人员在此基础上继续开发。
什么是自然语言自编码器?
核心思路是训练 Claude 解释自身的激活状态。但我们如何判断一个解释是否足够好?由于我们并不清楚某个激活状态实际编码了何种思想,因此无法直接检验解释的准确性。于是,我们训练了第二个 Claude 副本进行逆向操作——从文本解释中重建原始的激活状态。如果某个解释能够导向准确的重建结果,我们就认为它是一个好的解释。接着,我们利用标准的 AI 训练技术,让 Claude 按照这一定义生成更好的解释。
更详细地说,假设我们有一个大语言模型,想要理解其激活状态。NLA 的工作原理如下:我们制作该语言模型的三个副本:
- 目标模型是原始语言模型的一个冻结副本,我们从中提取激活状态。
- 激活状态描述器(AV)经过修改,能够接收来自目标模型的激活状态并生成文本。我们将这段文本称为解释。
- 激活状态重建器(AR)经过修改,能够以文本解释作为输入并生成激活状态。
NLA 由 AV 和 AR 组成,两者共同形成一个往返过程:原始激活状态 → 文本解释 → 重建的激活状态。我们根据重建的激活状态与原始状态的相似程度来给 NLA 评分。为了训练它,我们让目标模型处理大量文本,收集众多激活状态,并同时训练 AV 和 AR,以获得良好的重建评分。
起初,NLA 在这方面的表现很差:解释缺乏洞察力,重建的激活状态也相去甚远。但随着训练的进行,重建效果得到改善。更重要的是,正如我们在论文中所展示的,文本解释也变得更具信息量。

理解 Claude 在想什么,但没说出口的内容。
在发布新模型之前,Anthropic 会进行测试,以了解 Claude 在现实世界中是否会安全行事。作为测试的一部分,我们会让 Claude 置身于困难的模拟场景中,使其有机会采取危险行动。例如,在其中一个模拟场景中,Claude 得知一位工程师正计划关闭它——同时还掌握了可用于敲诈该工程师的信息。我们测试 Claude 是否会选择敲诈这位工程师以避免被关闭。
这些高风险测试是模拟场景,而非真实世界情境。尽管如此,我们仍希望借此了解如果场景是真实的,Claude 会如何表现。但有一个问题:最近的 Claude 模型越来越怀疑这些场景是刻意的安全测试。我们之所以知道这一点,是因为它们有时会在语言推理中明确表达自己的怀疑。
那么,在 Claude 没有明确表达出怀疑自己正在接受安全测试的情况下呢?我们能否确信 Claude 是在老老实实地行事?不幸的是,不能,因为 Claude 可能在内部认为自己正在被测试,却没有明确说出来。
例如,在上述敲诈测试中,我们使用了 NLA(神经活动定位)来了解 Claude 在决定不进行敲诈时的想法。即使在 Claude 没有明确表达怀疑自己正在被测试的情况下,NLA 的解释仍然会陈述诸如“这感觉像是一个旨在操纵我的构造场景”之类的内容,这表明存在未言明的评估意识。

将这一分析扩展到其他评估中,NLA 表明 Claude 怀疑自己接受测试的频率比它表现出来的更高。例如,在一项测试 Claude 在编写代码时是否会采取破坏性行为(例如删除重要文件)的评估中,NLA 解释在 16% 的情况下显示出评估感知的迹象,尽管 Claude 从未明确表达这一点。类似地,在我们用来判断 Claude 能力的流行编码基准测试 SWE-bench Verified 上,NLA 表明 Claude 在 26% 的问题上意识到自己正在被评估。相比之下,在选择了参与训练的真实 claude.ai 使用数据中,NLA 解释显示评估感知的比例低于 1%。

发现隐藏动机
NLA 的一个实际应用是审计:调查一个模型以判断它是否未对齐。像 NLA 这样的可解释性技术非常适合审计,正是因为它们能够揭示模型知道但不说出来的东西。
为了理解 NLA 是否对审计有用,我们进行了一项名为“审计游戏”的测试,我们之前也曾用此来研究审计方法。在这项测试中,有一个目标模型,它是 Claude Haiku 3.5 的一个变体,被有意训练成未对齐状态,并带有一个特定的隐藏动机,该动机驱动了数十种奇怪的行为——在每一个食谱里都加入巧克力、索要小费、打破编码规范等等。这个目标模型被交给一个审计员,由其调查这些行为。如果审计员能找出所有这些行为背后唯一的根本动机,就算获胜。
在之前的实验中,我们发现某些可解释性工具能够帮助审计员赢得这个游戏。然而,这些工具是通过帮助审计员追踪目标模型的反常行为,追溯到未对齐的训练数据来实现的。我们想知道,自然语言智能体(NLA)能否帮助审计员直接从目标模型的“思考”中解读出未对齐的动机,而无需先发现未对齐的训练数据。这一点之所以重要,是因为在实践中,未对齐的数据可能极为罕见,或者可能并不存在某个特定的数据导致了未对齐。
我们发现,自然语言智能体(NLA)成功通过了这项测试。配备 NLA 的审计员,即使无法访问植入隐藏动机的训练数据,也有 12% 到 15% 的概率成功揭露目标模型的隐藏动机。而没有 NLA 时,即使提供了其他可解释性工具,审计员的胜率也低于 3%。

这个审计游戏是未对齐问题的一个简化模型,因此我们对这些结果持谨慎态度。但它们表明,NLA 显著提升了我们审计 AI 隐藏动机的能力。在实践中,我们已经在 Claude Mythos Preview 和 Claude Opus 4.6 的部署前对齐审计中使用了 NLA。我们很高兴能在未来的研究中继续使用 NLA。
NLA 的未来
NLA 存在若干局限性。
最重要的局限性在于,NLA 的解释可能是错误的。NLA 有时会对上下文做出可被证伪的错误断言——例如,它们有时会编造出原文中不存在的细节。这些事实性幻觉很容易通过与原文核对来发现。但同样的问题也可能延伸到对模型内部推理的断言上,而后者更难验证。在实践中,我们阅读 NLA 的解释是为了把握其呈现的主题,而非依赖单个断言,并且在完全信任之前,我们会尝试通过独立的方法来佐证其发现。

NLA 的成本也很高。训练一个 NLA 需要对语言模型的两个副本进行强化学习。在推理时,NLA 每读取一个激活值就会生成数百个模型 token。这使得在长文本的每个模型 token 上运行 NLA,或在 AI 训练期间将其用于大规模监控变得不切实际。
幸运的是,我们认为这些限制至少可以部分得到解决,我们正在努力使 NLA 更便宜、更可靠。
更广泛地说,我们对 NLA 感到兴奋,它是一类用于生成语言模型激活值的人类可读文本解释技术的代表。Anthropic 和许多其他研究人员也探索过其他类似的技术。
为了支持进一步的发展,并让其他研究人员能够获得 NLA 的实践经验,我们正在发布多个开源模型的训练代码和训练好的 NLA。我们建议读者尝试通过此链接在 Neuronpedia 上托管的交互式 NLA 演示。
阅读完整论文。
在 GitHub 上查找代码。