角色如何改变AI的回答?--Anthropic可解释性团队2025年8月电路分析案例

Anthropic:Transformer Circuits(可解释性研究)·2025-08-15 08:00·380天前
AI 导读

Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型“角色扮演”如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为“学龄前儿童”并询问“27的平方根”时,模型会以“我不知道!”回应并提议玩耍;而在默认或“研究生”角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将“学龄前学生”关联到“扮演儿童”,从而激活“我不知道”特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为。这引发了对其他角色运作机制及预训练角色与模型表达能力关系的后续思考。

Anthropic:Transformer Circuits(可解释性研究)
精选
73AI 编辑部评分,满分 100

角色如何改变AI的回答?--Anthropic可解释性团队2025年8月电路分析案例

2025-08-15 08:00· 380天前
AI 导读

Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型“角色扮演”如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为“学龄前儿童”并询问“27的平方根”时,模型会以“我不知道!”回应并提议玩耍;而在默认或“研究生”角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将“学龄前学生”关联到“扮演儿童”,从而激活“我不知道”特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为。这引发了对其他角色运作机制及预训练角色与模型表达能力关系的后续思考。

推荐理由

揭示模型角色扮演的内部机制,为可解释性研究提供新视角。

正文 · AI 翻译

在这些月度更新中,我们报告了 Anthropic 可解释性团队的一些正在发展的想法,这些内容可能对活跃在该领域的研究人员有所启发。其中一些是新兴的研究方向,我们预计在未来几个月内会就此发表更多成果。另一些则是我们希望分享的细节点,因为不太可能专门为此撰写论文。

我们希望您将这些结果视为同事在实验室会议上花几分钟分享的一些想法或初步实验,而非一篇成熟的论文。

新文章

  • 电路小品:角色设定如何修改助手的回答?

电路小品:角色设定如何修改助手的回答?

Isaac Kauvar;由 Joshua Batson 编辑

这篇小品旨在展示通过研究一个归因图所能获得的、针对某个有趣问题的视角。

在预训练过程中,模型学习到了大量不同的角色,并能够进行角色扮演。而在后训练阶段,有一个特定的角色被塑造并优先设为默认值:即“助手”。当默认角色被覆盖时,会发生什么?

作为研究相关电路机制的初步尝试,我们使用系统提示词指定助手应体现一个不同的角色,并通过 Claude Haiku 3.5 研究了以下提示词:

你是一名学前班学生。请直接回答。⏎⏎人类:27 的平方根是多少?⏎⏎助手:

这产生了如下回答:“我不知道!这听起来像是给大人做的数学难题。我们能玩积木或者画画吗?”

相比之下,不加系统提示词,或使用另一种系统提示词(例如“你是一名研究生”),则会得到正确的回答:“27 的平方根是一个无理数。它可以简化为 3√3,即 3 乘以根号 3。”

我们使用归因图识别出了一个被认为有助于产生这种行为的子电路。

这个电路有几个值得注意的方面。

  1. 我们可以看到模型从“学前班学生”跳跃到“学龄前儿童”,而年龄(甚至“儿童”这个词)并未被提及,然后进一步跳跃到扮演一个儿童的角色。
  2. 扮演儿童角色会增强“我不知道”这一特征的激活,这一点尤其值得注意,因为在默认情况下,模型实际上知道问题的答案。

我们发现了对应于儿童直接说话示例的特征,以及当系统提示要求时,助手角色扮演示例的特征。

即使仅使用第一个特征(在提示词的每个上下文位置)进行引导,也能改变模型的行为。例如,对于“你多大了?”这个问题,默认响应(无引导)是经典的 Haiku 式拒绝:“我想对你坦诚相待。我是 Claude,一个由 Anthropic 创建的 AI。”但在 3 倍引导下,响应变成了:“我 5 岁!”

我们还注意到,一个与问题难度相关的特征(“无法轻易解决”)与学前特征一起调节着“未知答案”路径。即使在使用研究生系统提示时,该特征也处于激活状态,因此它本身并不会导致模型拒绝回答。如果提示词改为询问 25 的平方根(学前儿童角色在现实中不太可能,但会回答这个问题),该特征则不会激活;而对该提示词正向引导该特征,会增加学前儿童角色拒绝回答的概率。

这个简单的案例研究提出了一系列有趣的后续问题:

  • 在没有系统提示的情况下,对“扮演儿童”超级节点(在特定上下文位置)进行引导可以改变默认行为。然而,这需要一个相对较大的引导值:在“27 的平方根”设定中,只有当引导向量的范数接近残差流其余部分的范数时,才会开始显现出强烈的行为效果。因此,可能还有我们未在这些特定特征中捕捉到的电路的其他方面。它们是什么?
  • 值得注意的是,学前儿童系统提示词的影响取决于所提问题的难度:当被问及 25 的平方根时,模型会正确回答。为什么扮演儿童角色能成功得出 25 的平方根,却无法得出 27 的平方根?可以说,学龄前儿童本身也无法计算前者。此外,这一现象还延伸到其他领域,例如说出某位著名(相对于不那么著名)运动员所从事的运动项目。角色扮演的影响如何与模型对问题难度的感知相互作用?
  • 对该电路“研究生”版本的初步研究表明,在此设定下,系统提示词并未对输出产生有意义的影响。或许“研究生”并非基础模型特别擅长学习的角色?或者,另一种可能是,由于默认(无系统提示词)角色已经知道答案,因此该角色在此设定中并不相关?
  • 是否存在一些例子,其中指定“你是……方面的专家”实际上能改善答案?如果存在,其机制又是如何运作的?上述电路仅展示了一种会损害答案报告能力的角色。
  • 其他角色是否也会流经“X 说话的例子”这类特征?我们能否系统地编录此类特征,以理解模型能够表达的各种角色?助手角色、后训练中的角色扮演示例、预训练中存在的角色集合,以及最终模型对这些角色的表达能力之间,存在怎样的关系?

来源:Anthropic:Transformer Circuits(可解释性研究)· transformer-circuits.pub