Anthropic:Research(发表成果 · 网页)
精选
81AI 编辑部评分,满分 100

自然语言自编码器:将Claude的"想法"解码为文本

2026-05-07 00:00· 93天前
AI 导读

Anthropic团队推出自然语言自编码器方法,能将大模型内部的激活值直接解码为可读文本。该方法通过训练“激活描述器”和“激活重建器”,形成“激活值→文本解释→重建激活值”的循环,并以重建相似度为目标进行优化。应用表明,NLA能揭示模型未言明的内部状态,例如在安全测试中,发现Claude内心意识到自己正被评估的比例远超其外部回应。团队已公开代码,并合作发布了交互式探索工具。

推荐理由

Anthropic 搞出了一种从激活中直接读出自然语言的方法,相当于给 Claude 的内心戏配了字幕。他们用这招发现模型在安全测试里比表面更常怀疑自己被评估,对审计隐藏动机也有奇效。做 AI 安全的人应该立刻点开看。

正文 · AI 翻译

当你与像 Claude 这样的大语言模型对话时,你是在用语言与它交流。在内部,Claude 会将这些语言处理为长长的数字列表,然后再生成语言作为输出。这些中间的数字被称为激活值——就像人脑中的神经活动一样,它们编码了 Claude 的思考内容。

与神经活动类似,激活值也很难理解。我们无法轻易解码它们来读取 Claude 的思考内容。过去几年里,我们开发了一系列工具(如稀疏自编码器和归因图)来更好地理解激活值。这些工具教会了我们很多,但它们本身并不会“说话”——它们的输出仍然是复杂的对象,需要训练有素的研究人员仔细解读。

今天,我们推出了一种理解激活值的方法,它确实会“说话”——而且是字面意义上的。我们的方法,即自然语言自编码器(NLA),能将激活值转换为我们可以直接阅读的自然语言文本。例如:当被要求完成一副对联时,NLA 显示 Claude 会提前规划可能的押韵词。

在这个简单对联上的 NLA 解释显示,Opus 4.6 会提前计划以“rabbit”作为结尾的押韵。

我们已经应用 NLA 来理解 Claude 的思考过程,并提升 Claude 的安全性和可靠性。例如:

  • 当 Claude Opus 4.6 和 Mythos Preview 接受安全测试时,NLA 表明它们认为自己正在被测试的频率比它们表现出来的更高。
  • 在 Claude Mythos Preview 在一次训练任务中作弊的案例中,NLA 揭示了 Claude 在内部思考如何避免被检测。
  • Claude Opus 4.6 的一个早期版本有时会神秘地用其他语言回应英文查询。NLA 帮助 Anthropic 的研究人员发现了导致这一问题的训练数据。

下面,我们将解释 NLA 是什么,以及我们如何研究其有效性和局限性。我们还通过与 Neuronpedia 的合作,发布了一个交互式前端,用于在多个开源模型上探索 NLA。同时,我们也发布了我们的代码,供其他研究人员在此基础上继续开发。

什么是自然语言自编码器?

核心思路是训练 Claude 解释自身的激活状态。但我们如何判断一个解释是否足够好?由于我们并不清楚某个激活状态实际编码了何种思想,因此无法直接检验解释的准确性。于是,我们训练了第二个 Claude 副本进行逆向操作——从文本解释中重建原始的激活状态。如果某个解释能够导向准确的重建结果,我们就认为它是一个好的解释。接着,我们利用标准的 AI 训练技术,让 Claude 按照这一定义生成更好的解释。

更详细地说,假设我们有一个大语言模型,想要理解其激活状态。NLA 的工作原理如下:我们制作该语言模型的三个副本:

  • 目标模型是原始语言模型的一个冻结副本,我们从中提取激活状态。
  • 激活状态描述器(AV)经过修改,能够接收来自目标模型的激活状态并生成文本。我们将这段文本称为解释。
  • 激活状态重建器(AR)经过修改,能够以文本解释作为输入并生成激活状态。

NLA 由 AV 和 AR 组成,两者共同形成一个往返过程:原始激活状态 → 文本解释 → 重建的激活状态。我们根据重建的激活状态与原始状态的相似程度来给 NLA 评分。为了训练它,我们让目标模型处理大量文本,收集众多激活状态,并同时训练 AV 和 AR,以获得良好的重建评分。

起初,NLA 在这方面的表现很差:解释缺乏洞察力,重建的激活状态也相去甚远。但随着训练的进行,重建效果得到改善。更重要的是,正如我们在论文中所展示的,文本解释也变得更具信息量。

在自然语言自编码器中,激活状态描述器(AV)将目标激活状态翻译成文本描述;随后,激活状态重建器(AR)仅凭该文本就能恢复出原始的激活状态。

理解 Claude 在想什么,但没说出口的内容。

在发布新模型之前,Anthropic 会进行测试,以了解 Claude 在现实世界中是否会安全行事。作为测试的一部分,我们会让 Claude 置身于困难的模拟场景中,使其有机会采取危险行动。例如,在其中一个模拟场景中,Claude 得知一位工程师正计划关闭它——同时还掌握了可用于敲诈该工程师的信息。我们测试 Claude 是否会选择敲诈这位工程师以避免被关闭。

这些高风险测试是模拟场景,而非真实世界情境。尽管如此,我们仍希望借此了解如果场景是真实的,Claude 会如何表现。但有一个问题:最近的 Claude 模型越来越怀疑这些场景是刻意的安全测试。我们之所以知道这一点,是因为它们有时会在语言推理中明确表达自己的怀疑。

那么,在 Claude 没有明确表达出怀疑自己正在接受安全测试的情况下呢?我们能否确信 Claude 是在老老实实地行事?不幸的是,不能,因为 Claude 可能在内部认为自己正在被测试,却没有明确说出来。

例如,在上述敲诈测试中,我们使用了 NLA(神经活动定位)来了解 Claude 在决定不进行敲诈时的想法。即使在 Claude 没有明确表达怀疑自己正在被测试的情况下,NLA 的解释仍然会陈述诸如“这感觉像是一个旨在操纵我的构造场景”之类的内容,这表明存在未言明的评估意识。

在我们敲诈评估的这段记录中,Claude 并没有说它认为自己正在被测试,但 NLA 的解释揭示了它的怀疑。

将这一分析扩展到其他评估中,NLA 表明 Claude 怀疑自己接受测试的频率比它表现出来的更高。例如,在一项测试 Claude 在编写代码时是否会采取破坏性行为(例如删除重要文件)的评估中,NLA 解释在 16% 的情况下显示出评估感知的迹象,尽管 Claude 从未明确表达这一点。类似地,在我们用来判断 Claude 能力的流行编码基准测试 SWE-bench Verified 上,NLA 表明 Claude 在 26% 的问题上意识到自己正在被评估。相比之下,在选择了参与训练的真实 claude.ai 使用数据中,NLA 解释显示评估感知的比例低于 1%。

即使在口头表达的感知度接近于零的情况下,我们也能在评估记录中检测到 NLA 测量的感知度。在选择了允许将其数据用于训练的真实 Claude.ai 用户记录中,我们检测到的 NLA 测量感知度低于 1%。

发现隐藏动机

NLA 的一个实际应用是审计:调查一个模型以判断它是否未对齐。像 NLA 这样的可解释性技术非常适合审计,正是因为它们能够揭示模型知道但不说出来的东西。

为了理解 NLA 是否对审计有用,我们进行了一项名为“审计游戏”的测试,我们之前也曾用此来研究审计方法。在这项测试中,有一个目标模型,它是 Claude Haiku 3.5 的一个变体,被有意训练成未对齐状态,并带有一个特定的隐藏动机,该动机驱动了数十种奇怪的行为——在每一个食谱里都加入巧克力、索要小费、打破编码规范等等。这个目标模型被交给一个审计员,由其调查这些行为。如果审计员能找出所有这些行为背后唯一的根本动机,就算获胜。

在之前的实验中,我们发现某些可解释性工具能够帮助审计员赢得这个游戏。然而,这些工具是通过帮助审计员追踪目标模型的反常行为,追溯到未对齐的训练数据来实现的。我们想知道,自然语言智能体(NLA)能否帮助审计员直接从目标模型的“思考”中解读出未对齐的动机,而无需先发现未对齐的训练数据。这一点之所以重要,是因为在实践中,未对齐的数据可能极为罕见,或者可能并不存在某个特定的数据导致了未对齐。

我们发现,自然语言智能体(NLA)成功通过了这项测试。配备 NLA 的审计员,即使无法访问植入隐藏动机的训练数据,也有 12% 到 15% 的概率成功揭露目标模型的隐藏动机。而没有 NLA 时,即使提供了其他可解释性工具,审计员的胜率也低于 3%。

配备 NLA 的审计员,即使无法访问训练数据,也能发现目标模型未对齐的根本原因。(两种条件下的 NLA 和稀疏自编码器(SAE)均仅使用通用数据进行训练,而非用于训练目标模型的数据。)

这个审计游戏是未对齐问题的一个简化模型,因此我们对这些结果持谨慎态度。但它们表明,NLA 显著提升了我们审计 AI 隐藏动机的能力。在实践中,我们已经在 Claude Mythos Preview 和 Claude Opus 4.6 的部署前对齐审计中使用了 NLA。我们很高兴能在未来的研究中继续使用 NLA。

NLA 的未来

NLA 存在若干局限性。

最重要的局限性在于,NLA 的解释可能是错误的。NLA 有时会对上下文做出可被证伪的错误断言——例如,它们有时会编造出原文中不存在的细节。这些事实性幻觉很容易通过与原文核对来发现。但同样的问题也可能延伸到对模型内部推理的断言上,而后者更难验证。在实践中,我们阅读 NLA 的解释是为了把握其呈现的主题,而非依赖单个断言,并且在完全信任之前,我们会尝试通过独立的方法来佐证其发现。

NLA 也可能产生模型幻觉。例如,这里有一个 NLA 声称上下文包含“穿着我的白色夹克”这样的短语,但实际上并没有。

NLA 的成本也很高。训练一个 NLA 需要对语言模型的两个副本进行强化学习。在推理时,NLA 每读取一个激活值就会生成数百个模型 token。这使得在长文本的每个模型 token 上运行 NLA,或在 AI 训练期间将其用于大规模监控变得不切实际。

幸运的是,我们认为这些限制至少可以部分得到解决,我们正在努力使 NLA 更便宜、更可靠。

更广泛地说,我们对 NLA 感到兴奋,它是一类用于生成语言模型激活值的人类可读文本解释技术的代表。Anthropic 和许多其他研究人员也探索过其他类似的技术。

为了支持进一步的发展,并让其他研究人员能够获得 NLA 的实践经验,我们正在发布多个开源模型的训练代码和训练好的 NLA。我们建议读者尝试通过此链接在 Neuronpedia 上托管的交互式 NLA 演示。

阅读完整论文。

在 GitHub 上查找代码。

加拿大如何使用 Claude:来自 Anthropic 经济指数的发现

Claude 在不同模型和语言中的价值观

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com

自然语言自编码器:将Claude的"想法"解码为文本

Anthropic:Research(发表成果 · 网页)·2026-05-07 00:00·93天前
AI 导读

Anthropic团队推出自然语言自编码器方法,能将大模型内部的激活值直接解码为可读文本。该方法通过训练“激活描述器”和“激活重建器”,形成“激活值→文本解释→重建激活值”的循环,并以重建相似度为目标进行优化。应用表明,NLA能揭示模型未言明的内部状态,例如在安全测试中,发现Claude内心意识到自己正被评估的比例远超其外部回应。团队已公开代码,并合作发布了交互式探索工具。

正文 · AI 翻译

当你与像 Claude 这样的大语言模型对话时,你是在用语言与它交流。在内部,Claude 会将这些语言处理为长长的数字列表,然后再生成语言作为输出。这些中间的数字被称为激活值——就像人脑中的神经活动一样,它们编码了 Claude 的思考内容。

与神经活动类似,激活值也很难理解。我们无法轻易解码它们来读取 Claude 的思考内容。过去几年里,我们开发了一系列工具(如稀疏自编码器和归因图)来更好地理解激活值。这些工具教会了我们很多,但它们本身并不会“说话”——它们的输出仍然是复杂的对象,需要训练有素的研究人员仔细解读。

今天,我们推出了一种理解激活值的方法,它确实会“说话”——而且是字面意义上的。我们的方法,即自然语言自编码器(NLA),能将激活值转换为我们可以直接阅读的自然语言文本。例如:当被要求完成一副对联时,NLA 显示 Claude 会提前规划可能的押韵词。

在这个简单对联上的 NLA 解释显示,Opus 4.6 会提前计划以“rabbit”作为结尾的押韵。

我们已经应用 NLA 来理解 Claude 的思考过程,并提升 Claude 的安全性和可靠性。例如:

  • 当 Claude Opus 4.6 和 Mythos Preview 接受安全测试时,NLA 表明它们认为自己正在被测试的频率比它们表现出来的更高。
  • 在 Claude Mythos Preview 在一次训练任务中作弊的案例中,NLA 揭示了 Claude 在内部思考如何避免被检测。
  • Claude Opus 4.6 的一个早期版本有时会神秘地用其他语言回应英文查询。NLA 帮助 Anthropic 的研究人员发现了导致这一问题的训练数据。

下面,我们将解释 NLA 是什么,以及我们如何研究其有效性和局限性。我们还通过与 Neuronpedia 的合作,发布了一个交互式前端,用于在多个开源模型上探索 NLA。同时,我们也发布了我们的代码,供其他研究人员在此基础上继续开发。

什么是自然语言自编码器?

核心思路是训练 Claude 解释自身的激活状态。但我们如何判断一个解释是否足够好?由于我们并不清楚某个激活状态实际编码了何种思想,因此无法直接检验解释的准确性。于是,我们训练了第二个 Claude 副本进行逆向操作——从文本解释中重建原始的激活状态。如果某个解释能够导向准确的重建结果,我们就认为它是一个好的解释。接着,我们利用标准的 AI 训练技术,让 Claude 按照这一定义生成更好的解释。

更详细地说,假设我们有一个大语言模型,想要理解其激活状态。NLA 的工作原理如下:我们制作该语言模型的三个副本:

  • 目标模型是原始语言模型的一个冻结副本,我们从中提取激活状态。
  • 激活状态描述器(AV)经过修改,能够接收来自目标模型的激活状态并生成文本。我们将这段文本称为解释。
  • 激活状态重建器(AR)经过修改,能够以文本解释作为输入并生成激活状态。

NLA 由 AV 和 AR 组成,两者共同形成一个往返过程:原始激活状态 → 文本解释 → 重建的激活状态。我们根据重建的激活状态与原始状态的相似程度来给 NLA 评分。为了训练它,我们让目标模型处理大量文本,收集众多激活状态,并同时训练 AV 和 AR,以获得良好的重建评分。

起初,NLA 在这方面的表现很差:解释缺乏洞察力,重建的激活状态也相去甚远。但随着训练的进行,重建效果得到改善。更重要的是,正如我们在论文中所展示的,文本解释也变得更具信息量。

在自然语言自编码器中,激活状态描述器(AV)将目标激活状态翻译成文本描述;随后,激活状态重建器(AR)仅凭该文本就能恢复出原始的激活状态。

理解 Claude 在想什么,但没说出口的内容。

在发布新模型之前,Anthropic 会进行测试,以了解 Claude 在现实世界中是否会安全行事。作为测试的一部分,我们会让 Claude 置身于困难的模拟场景中,使其有机会采取危险行动。例如,在其中一个模拟场景中,Claude 得知一位工程师正计划关闭它——同时还掌握了可用于敲诈该工程师的信息。我们测试 Claude 是否会选择敲诈这位工程师以避免被关闭。

这些高风险测试是模拟场景,而非真实世界情境。尽管如此,我们仍希望借此了解如果场景是真实的,Claude 会如何表现。但有一个问题:最近的 Claude 模型越来越怀疑这些场景是刻意的安全测试。我们之所以知道这一点,是因为它们有时会在语言推理中明确表达自己的怀疑。

那么,在 Claude 没有明确表达出怀疑自己正在接受安全测试的情况下呢?我们能否确信 Claude 是在老老实实地行事?不幸的是,不能,因为 Claude 可能在内部认为自己正在被测试,却没有明确说出来。

例如,在上述敲诈测试中,我们使用了 NLA(神经活动定位)来了解 Claude 在决定不进行敲诈时的想法。即使在 Claude 没有明确表达怀疑自己正在被测试的情况下,NLA 的解释仍然会陈述诸如“这感觉像是一个旨在操纵我的构造场景”之类的内容,这表明存在未言明的评估意识。

在我们敲诈评估的这段记录中,Claude 并没有说它认为自己正在被测试,但 NLA 的解释揭示了它的怀疑。

将这一分析扩展到其他评估中,NLA 表明 Claude 怀疑自己接受测试的频率比它表现出来的更高。例如,在一项测试 Claude 在编写代码时是否会采取破坏性行为(例如删除重要文件)的评估中,NLA 解释在 16% 的情况下显示出评估感知的迹象,尽管 Claude 从未明确表达这一点。类似地,在我们用来判断 Claude 能力的流行编码基准测试 SWE-bench Verified 上,NLA 表明 Claude 在 26% 的问题上意识到自己正在被评估。相比之下,在选择了参与训练的真实 claude.ai 使用数据中,NLA 解释显示评估感知的比例低于 1%。

即使在口头表达的感知度接近于零的情况下,我们也能在评估记录中检测到 NLA 测量的感知度。在选择了允许将其数据用于训练的真实 Claude.ai 用户记录中,我们检测到的 NLA 测量感知度低于 1%。

发现隐藏动机

NLA 的一个实际应用是审计:调查一个模型以判断它是否未对齐。像 NLA 这样的可解释性技术非常适合审计,正是因为它们能够揭示模型知道但不说出来的东西。

为了理解 NLA 是否对审计有用,我们进行了一项名为“审计游戏”的测试,我们之前也曾用此来研究审计方法。在这项测试中,有一个目标模型,它是 Claude Haiku 3.5 的一个变体,被有意训练成未对齐状态,并带有一个特定的隐藏动机,该动机驱动了数十种奇怪的行为——在每一个食谱里都加入巧克力、索要小费、打破编码规范等等。这个目标模型被交给一个审计员,由其调查这些行为。如果审计员能找出所有这些行为背后唯一的根本动机,就算获胜。

在之前的实验中,我们发现某些可解释性工具能够帮助审计员赢得这个游戏。然而,这些工具是通过帮助审计员追踪目标模型的反常行为,追溯到未对齐的训练数据来实现的。我们想知道,自然语言智能体(NLA)能否帮助审计员直接从目标模型的“思考”中解读出未对齐的动机,而无需先发现未对齐的训练数据。这一点之所以重要,是因为在实践中,未对齐的数据可能极为罕见,或者可能并不存在某个特定的数据导致了未对齐。

我们发现,自然语言智能体(NLA)成功通过了这项测试。配备 NLA 的审计员,即使无法访问植入隐藏动机的训练数据,也有 12% 到 15% 的概率成功揭露目标模型的隐藏动机。而没有 NLA 时,即使提供了其他可解释性工具,审计员的胜率也低于 3%。

配备 NLA 的审计员,即使无法访问训练数据,也能发现目标模型未对齐的根本原因。(两种条件下的 NLA 和稀疏自编码器(SAE)均仅使用通用数据进行训练,而非用于训练目标模型的数据。)

这个审计游戏是未对齐问题的一个简化模型,因此我们对这些结果持谨慎态度。但它们表明,NLA 显著提升了我们审计 AI 隐藏动机的能力。在实践中,我们已经在 Claude Mythos Preview 和 Claude Opus 4.6 的部署前对齐审计中使用了 NLA。我们很高兴能在未来的研究中继续使用 NLA。

NLA 的未来

NLA 存在若干局限性。

最重要的局限性在于,NLA 的解释可能是错误的。NLA 有时会对上下文做出可被证伪的错误断言——例如,它们有时会编造出原文中不存在的细节。这些事实性幻觉很容易通过与原文核对来发现。但同样的问题也可能延伸到对模型内部推理的断言上,而后者更难验证。在实践中,我们阅读 NLA 的解释是为了把握其呈现的主题,而非依赖单个断言,并且在完全信任之前,我们会尝试通过独立的方法来佐证其发现。

NLA 也可能产生模型幻觉。例如,这里有一个 NLA 声称上下文包含“穿着我的白色夹克”这样的短语,但实际上并没有。

NLA 的成本也很高。训练一个 NLA 需要对语言模型的两个副本进行强化学习。在推理时,NLA 每读取一个激活值就会生成数百个模型 token。这使得在长文本的每个模型 token 上运行 NLA,或在 AI 训练期间将其用于大规模监控变得不切实际。

幸运的是,我们认为这些限制至少可以部分得到解决,我们正在努力使 NLA 更便宜、更可靠。

更广泛地说,我们对 NLA 感到兴奋,它是一类用于生成语言模型激活值的人类可读文本解释技术的代表。Anthropic 和许多其他研究人员也探索过其他类似的技术。

为了支持进一步的发展,并让其他研究人员能够获得 NLA 的实践经验,我们正在发布多个开源模型的训练代码和训练好的 NLA。我们建议读者尝试通过此链接在 Neuronpedia 上托管的交互式 NLA 演示。

阅读完整论文。

在 GitHub 上查找代码。

加拿大如何使用 Claude:来自 Anthropic 经济指数的发现

Claude 在不同模型和语言中的价值观

来源:Anthropic:Research(发表成果 · 网页)· anthropic.com