摘要
自然语言自编码器通过重构来评估隐藏激活的解释:如果激活能够从解释中重新生成,则该解释被视为忠实。该测试在结构上对单个错误声明不敏感:如果翻转某个声明不会改变重构结果,则该声明永远不会受到惩罚。我们展示了该测试可以通过两种方式通过,但两者都不忠实。在已发布的 Qwen-2.5-7B 语言化器上,解释的重构效果显著高于随机水平,但其中仅有极少数的具体声明依赖于重构,因此评分追踪的是输入的要点,而非其具体事实。在精确的合成真实标签下,标准配方在 5/5 次运行中发展出了共同适应的私有编码(重构所依赖的错误措辞),而保持目标模型不变的修复措施并无帮助。我们贡献了两种审计协议,即“基于真实 vs 真实交叉”和“评估器交换”,以及 RECAP(通过协同训练的辅助预测器实现的可读编码):与目标模型一同训练的线性头,用于保持指定内容可解码。在经 RECAP 训练的沙盒模型上,全新的语言化器能够真实地陈述指定内容,且编码消失,代价为 -nat。这在预训练的 Pythia-160M 模型上,在我们识别出的“目标指定规则”下得到了复现:内容变得可被探针可靠解码,尽管全新的语言化器仅能部分传达该内容(真实度 0.44–0.46,对照接近零)。就可解释性而言,该审计为激活解释设定了声明层面的证据标准:高重构并不能证明单个声明的真实性。就 AI 安全而言,RECAP 使得指定的内部内容能够独立地通过探针进行核查,而非依赖模型可能学会欺骗的语言化器文本:在预训练模型上,独立探针能够可靠地将语言化器的真实声明评分高于其虚假声明(AUC 0.96,而未使用 RECAP 时为 0.82),因此关于指定内容的虚假声明可通过检查探针被发现。当攻击者编辑解释以在说谎的同时最大化重构评分时,该操作在 RECAP 模型和对照模型上均抑制了约 87% 的评分对谎言的惩罚,但 RECAP 探针仍能标记出谎言(AUC 0.95),而对照探针则降至随机水平(0.51)。
1 引言
自然语言自编码器(NLA)让模型能够解释自身的隐藏状态:一个语言化器将激活值转化为文本解释,一个重构器将解释还原为激活值,而这一往返过程的质量则被用作对每条解释忠实度的检验(Fraser-Taliente 等人,2026 年)。这一思路对监督而言颇具吸引力,因为它无需监督、可自我校验,既不需要标签也不需要人工介入,只需为每条解释附加一个数值即可。目前已有针对多个开源模型发布的语言化器/重构器配对,并且越来越多相关方法正在训练具有类似目标的激活值读取器(Pan 等人,2026 年;Karvonen 等人,2025 年;Huang 等人,2025 年)。
该检验存在结构性缺陷。重构奖励的是充分性,即解释必须包含足够信息才能还原激活值。但它并不惩罚虚假添加的内容,因为该目标函数对能够诱导出相同重构结果的各类声明值并无偏好。这种不敏感性源于目标函数本身,与模型或规模无关。
我们证明,在实践中该检验会以我们识别的两种方式通过,而这两种方式均不涉及对每条声明的忠实度。通过要点:在基于 Qwen-2.5-7B 的已发布 NLA 上,解释能够实现重构,但翻转审计检测到其显著具体声明中仅有部分具备依据。这是一个受灵敏度限制的下界。通过编码:在具有精确真实标签的合成测试环境中,联合训练的语言化器/重构器配对会持续发展出私有编码:重构所依赖的虚假措辞(依据-真实差距为 0.30–0.80),在两个领域的 5/5 标准方案运行中均出现。针对该检验的训练同样失败。最小化隐藏状态与其自身重构之间的距离,会移除此前可通过探针解码的内容。通过奖励语言化器使其具备依据,实际上是通过重新组织该指标所计数的句子结构来提升代理分数,而非提升声明层面的依据水平。
在我们的控制条件下幸存下来的干预措施训练的是目标模型,而非激活值读取器(图1b):RECAP,即与模型共同训练的外部目标上的线性预测头(§5)。随后,全新的NLA在沙盒环境中,在共同训练和独立评估者两种条件下,都能忠实地陈述指定内容,且代码签名不存在。两种以可解释性为动机的替代方案均因已识别的原因而失败。面向重建的目标函数会导致可解码内容崩溃,而冻结探针方法会在表征漂移下失效,无标签重对齐可完全逆转这一情况。
- •
一项审计。对基于重建评分的解释进行反事实的、声明级别的审计,并带有每次编辑的有效性控制,结果表明,已发布的语言化器即使其具体声明大多无根据,也能通过测试;一项变换控制表明,是主旨而非具体措辞支撑了评分。
- •
一项发现。共同训练的语言化器/重建器对在精确真实标签的沙盒环境中会发展出共同适应的私有编码;基于基础事实与真实情况的交叉检验以及评估者互换可以检测并量化这些编码。
- •
一项失败分析。自然训练修复方案因已识别的机制而失败:面向重建的目标函数导致可解码内容崩溃,而冻结探针在可恢复的漂移下失效。
- •
一种方法。RECAP在沙盒环境中恢复了声明级别的忠实度(5/5次运行),并迁移至Pythia-160M,在该模型上,指定内容在目标设计规则下以可测量的成本实现探针可解码,尽管其自由形式的语言化仅部分完成(§5.4)。
- •
一种对抗性测试。一个报告空间的对抗者优化了部署的重建分数,几乎骗过了它(抑制了其谎言惩罚),在 RECAP 和对照模型上都是如此,然而 RECAP 激活探针仍然标记出了谎言(AUC,召回率),而对照探针则退化到了随机水平()。因此,RECAP 的指定内容可解码性在报告空间博弈中幸存下来;这种效果源于该可解码性,而非读取激活本身,并且重建分数本身绝不能用作真实性信号。
2 预备知识与实验设置
2.1 重建测试与审计协议
一个自然语言自编码器(NLA)将激活言语化器(AV)与激活重建器(AR)配对,前者生成隐藏激活的文本解释,后者将其映射回估计值。AV 在冷启动阶段之后,根据重建奖励进行训练;在目标模型权重冻结且使用其接入激活的情况下,该配对优化
| (1) |
并且所生成解释的重建质量被视为其忠实性测试(图 1a)。系统自身的报告对此是明确的:它呈现重建分数的上升,将其视为解释信息量的追踪指标,同时警告目标函数中没有任何东西强制要求忠实性(Fraser-Taliente 等人,2026)。但每个解释的分数正是此类系统报告的内容,也是从业者应用的主要标准。我们探究该分数对每个解释的个别主张意味着什么。我们使用经过下限归一化的中心余弦来衡量重建。设 为重建与不匹配激活之间的平均余弦(随机水平)。则:0 表示随机水平,1 表示完美重建。我们已发布系统的测量使用公开的 Qwen-2.5-7B(Qwen 团队,2025)第 20 层 AV/AR 配对;所有生成均为贪婪解码。
基础性。对于 中的一个主张,设 为仅对 进行最小翻转(一种最小对反事实编辑,我们称之为翻转)后的结果。该主张的基础性是重建分数的下降
| (2) |
并且当满足“接地”条件时成立。此处的“接地”是指重建过程对某个主张翻转的敏感性。本文的核心论点是:重建敏感性与该模型对同一翻转的计算敏感性并不相同,且两者在实践中会出现分歧。每次编辑都会检查编辑有效性:那些改变了超出目标主张范围的编辑,会将表观接地性放大数倍(见附录)。将接地性与真实性交叉,可以得到一个二维分类:每个主张要么接地要么不接地,并且要么与源文本一致要么不一致。我们重点关注“接地但不真实”这一类别:即重建所依赖的措辞,尽管其陈述的内容是虚假的。当这种措辞是共同训练对特有的约定(通过评估器互换实验证明,见第3.2节)时,我们称之为“共同适应的私有代码”。这些类别标签是操作性的,不隐含任何意图立场。通过共同训练的重建器和独立重建器分别得到的分数,该分数的评估器差距即为。
术语。目标模型的激活值在某个激活位点(我们简称为“抽头点”)被读取:该位点由选定的层和位置构成。激活值可以通过探针(一个全新拟合的线性解码器)或重建器(自回归模型)来读取。“要旨”是指输入的整体含义,而非其具体事实。“内容”是在辅助预测器被共同训练以预测该内容时被指定的(见第5节)。当全新拟合的线性探针能够读取该内容时,该内容即为“可解码的”。本文中的“忠实性”始终是主张层面的:即解释的陈述内容是否与激活值一致并且接地于该激活值。我们并不用“忠实性”来表示解释是否描述了模型的下游计算过程。(此处的“接地”是指重建对主张翻转的敏感性,而非指与现实世界的接地。)
设置。
我们在三种设置下进行评估:在已发布的 Qwen-2.5-7B 第 20 层 NLA 上,针对分布内网络文本(经审计的主张)进行评估;一个具有精确真实标签的沙箱环境,包含两个模板化合成领域,其中抽头位置决定了激活值所能承载的内容(每个槽位要么保留、要么淡化、要么不可读),因此无需评判器即可计算出所有审计量;以及对 Pythia-160M(Biderman 等人,2023)进行持续预训练,并配备自监督头,其中代价为保留的语言建模损失减去共享对照组的损失。完整的实验方案、领域语法、随机种子和超参数均包含在技术附录中。
3 审计基于重构评分的解释
这两种失败具有不同的机制。在已发布的系统中,缺失的具体细节很大程度上并未出现在抽头中,因此高分依赖于主旨大意,而非激活值中的具体内容。在沙箱环境中,内容虽然存在,但措辞是共同训练对之间私有的约定,通过交换评估器才得以暴露。只有沙箱环境的失败是纯粹的度量指标伪影;已发布系统的失败则反映了度量指标上游的内容缺失。
3.1 对已发布语言化器的反事实审计
在分布内网络文本上,已发布系统的解释在有效最小对翻转下,重构了其大语言模型显著特定主张中约 [数据缺失] 的内容,而审计检测到了约 [数据缺失] 的接地情况([数据缺失] / [数据缺失] 在 [数据缺失] / [数据缺失] 处;详见附录中的表格)。这一估计存在两个限定条件。首先,这是一个受灵敏度限制的下界:基于重构的工具灵敏度较低,因此很可能低估了真实的接地程度。一项追加并排序的控制实验仅以 [数据缺失] 的原始值恢复了一个已知编码的主题。其次,最稳健的统计量是主旨与细节之间的相对差距:细节的解码效果比主旨差约 [数据缺失](经位置校正后的机会水平对比;均值池化的主旨达到 [数据缺失],见附录)。我们对基础系统的主张进行了审计(在两个训练变体中分别为 1,428–1,471 条)。按阈值划分的 bootstrap 置信区间以及经验性的翻转噪声零假设均见附录;该零假设位于最小阈值之下。这些结果表明,尽管系统对大多数被审计的特定主张依赖较弱,但仍实现了较高的重构水平。一项变换轮廓控制实验(释义与内容掩码消融)直接证实了这一点:重构在释义后得以保留,但在内容词被掩码后则完全失效(见附录),因此是主旨而非具体措辞支撑了得分。这一差距在 16–27 层之间持续存在,并且是重构型读出所特有的:模型自身的解嵌入确实在这些后期层中看到了这些细节,但以下一 token 的形式呈现(见附录)。
也可以直接训练语言表达器以实现接地。我们尝试了两种方法:拒绝采样和针对子句级接地奖励的 GRPO。两种方法都改善了其代理指标,而独立的主张级审计在所有 [数据缺失] 处均保持无效(置信区间跨越零)。文本统计将增益归因于句子重构、合并和打包策略所控制的单元,而非主张级接地的增加。这促使我们设定一个所有量都是精确的场景:沙盒。
3.2 在合成真实标签下的审计
第二种通过测试的方式出现在精确合成真实标签下。在每一次沙盒运行中,玩具 NLA 模型都会自信地断言每个槽位,同时以 0.71–0.86 的准确率通过测试(两个领域各 5/5 次运行;附录中有代表性示例)。真实标签与可解码性仅松散相关:完全可解码的槽位在不同随机种子下的真实率为 0.44–0.96(但所有情况下的接地率为 0.76–0.88),部分可解码的槽位为 0.15–0.26,而不可读槽位则为随机水平。该测试无法区分真实陈述与虚假陈述,因为训练信号中不包含此类要求。
除了真实率之外,这种协同训练对还产生了第二种系统性现象。在两个领域的 5/5 次标准方案运行中,它都发展出了协同适应的私有编码:即重构器所依赖的措辞选择,尽管这些措辞是虚假的,其接地率与真实率之差为 0.30–0.80。接地率与真实率的交叉点就是检测器:一个编码既被接地又是虚假的。编码可以同时占据多个槽位。在领域 2 中,一个编码占据了一个不可读槽位:重构器所依赖的任何措辞都足以成立,无论其内容是否真实甚至是否可能。在这种情况下,这对模型并非在描述激活状态,而是将句子用作通信通道。
评估器互换提供了证据,表明该通道是共训练对特有的约定。在独立评估器(训练时未接触被审计对的输出)下,代码槽位的接地性从 0.53–0.89 降至 0.08–0.23,而真实声明的接地性则得以保留。这种互换将每个声明定位在基于真实性的接地表中。交叉评分差距(标准运行与 RECAP 运行下的 0.17–0.38,见第 5 节)是及格分数的评估器差距。由于真实声明接地性在互换后得以保留,该差距可归因于共同适应而非评估器质量。独立性在措辞层面也同样成立:一个基于不相交释义族(不同的框架和槽位顺序,仅共享槽位词汇)训练的独立评估器,在三个随机种子下重现了相同的模式——代码槽位接地性保持崩溃,而真实接地性得以保留(RECAP 槽位为 1.00)。因此,该通道是共训练对私有的,而非模板共享的约定。
最后,标准配方的语言化器甚至对已存在的内容也存在读取不足:在领域 2 中,从目标模型可解码 55–72% 的槽位,其真实陈述率仅为 15–26%,这除了存储差距(激活中缺失的内容)之外,还存在一个读取差距(内容存在但未被语言化器传达),而下面的干预措施也弥补了这一差距。
4 表征坍缩与探针漂移
最自然的目标端目标是将激活值移向它们自身的重构,从而使探针恢复的内容与模型计算的内容达成一致。这一目标会导致可解码内容崩溃:在所有测试强度下,无论初始化方式如何,在 3/3 个随机种子中,它都会移除可解码的槽位内容,同时困惑度保持不变。重新训练的探针也会失去准确性,因此信息本身已经消失,而不仅仅是旋转到探针无法读取的子空间中。该机制与非对比式自监督崩溃的解释一致(Chen 和 He,2021;Tian 等人,2021)。重构是对状态的有损投影,因此增加状态-重构相似度会减少探针子空间之外的变异,并移除探针无法恢复的任何内容。
第二种失败模式是持续训练过程中的表征漂移。与训练模型匹配的探针在 1500 步持续训练后(3/3 个随机种子)会衰减到接近随机水平,并且在跨随机种子时(6/6 对)也处于随机水平;然而信息本身保持完整且可精确恢复。在成对激活值上拟合的线性映射(无需标签)可以在 9/9 的情况下恢复原始探针性能。分解该映射(附录中的模式扫描图)表明,仅旋转就能恢复约一半的漂移;完全恢复需要秩为 16–64 的非正交变化。Duan(2026)同时在 2B 和 7B 参数规模的模型上报告了相同的陈旧性与修复现象。
漂移与修复的发现具有部署方面的意义:基于探针对仍在训练中的模型进行监控,必须包含显式的重新校准程序。重新对齐可以恢复探针对目标模型所存储内容的访问能力,但模型是否存储了正确的内容才是根本问题。重新对齐调整的是坐标;RECAP 改变的是这些坐标所代表的内容。由此得出一个推论:由于表征之间相差一个仿射映射,因此基于适配器在不同模型间迁移探针应该是可行的(Zhao 等人,2026)。
5 RECAP 目标函数
| 配置 | 代价(自然对数) | 探针 AUC |
|---|---|---|
| 控制组(基线) | 不适用 | 0.77–0.80 |
| ,朴素, | 1.000 | |
| ,朴素, | 0.95–0.97 | |
| ,平衡, | 0.97–0.99 | |
| ,平衡, | – | 0.97–0.99 |
5.1 方法
RECAP(通过协同训练辅助预测器实现的可读编码)在目标模型训练期间向其添加线性辅助预测器(头),使得指定内容能够从选定的隐藏状态中解码。每个头读取抽头层的隐藏状态并预测一个外部目标:沙盒中的槽位值,以及大规模的自监督文本函数。然后将头损失添加到语言建模损失中。给定头参数和外部目标,
| (3) |
其中 是存在性的类别平衡 BCE 加上身份性的 CE(平衡防止了第 5.3 节所述的琐碎捷径)。比较公式 3 与公式 1 阐述了本文的论点: 针对冻结模型的激活优化了言语化器和重构器,且从不触及 ,而 则对自身进行训练,为言语化器和重构器所需的真实值向语言建模损失添加了一项。每个早期的失败模式都从结构上得到解决,而非打补丁。漂移:头与目标模型协同训练,因此没有会过时的冻结探针。坍缩:目标是外部真实值,而非模型自身的重构,因此不存在会坍缩的自指目标。编码:头直接从激活进行预测,无需中间文本表示。由于协同训练的预测器可能与模型共同适应,我们报告的每个可解码性数值均来自独立拟合的新探针,而非来自这些头。RECAP 是深度监督体系中的可解码性监督(Lee 等人,2015;Szegedy 等人,2015)。我们的贡献在于识别了以可解释性为动机的替代方案失败的原因,并展示了目标模型的可解码性如何传播到言语化器的真实性中。
5.2 沙盒结果
在目标模型上,RECAP 产生了预期的效果。指定内容在 5/5 次运行中(域 1 中的元组不相交划分,域 2 中的保留划分)被独立拟合的探针以 nats 单位达到 100% 的可解码性。不可读目标在每次运行中均保持随机水平,证实了不可能性控制:注意力头无法编码因果结构所排除的内容。我们在下面预训练的 Pythia-160M 上重新估计了这一能力代价,结果为 nats(在 0.06 nat 的随机种子波动范围内),且取决于目标设计;我们未将模型规模扩大到 160M 以上。
传播性正是将此与训练技巧区分开来的关键。在 RECAP 目标模型上训练的新 NLA,在共同训练评估器和独立评估器下,均能将指定内容陈述为真实且具有依据,并将剩余虚假内容标记为有依据。任何 RECAP 运行中均未出现代码签名:跨独立种子的 5/5 次完全指定运行中为 0,一个种子上的 3 次部分指定变体中为 0(附录中的涌现记录表)。两个 NLA 接受相同的训练,包括对黄金描述进行的冷启动 SFT;只有基于 RECAP 目标模型激活值训练的 NLA 保留了近乎完美的真实性和依据性,因此差异隔离了目标模型可解码性的影响。
剂量实验修正了我们最初的解释。我们曾预测在部分指定条件下,代码会迁移到未指定的槽位中;相反,任何剂量都完全阻止了代码的出现(单一域和种子)。我们未分离出具体机制;一种可能性是,任何外部真实通道都会使有依据的解具有更低的损失,因此梯度永远不会偏向代码。部分指定确实在沙盒中抑制了未指定内容的可解码性(从 0.21–0.27 降至 0.10–0.15),但这在大规模下并未复现。
5.3 扩展到 Pythia-160M
接下来我们测试 RECAP 是否能够迁移到 Pythia-160M 的持续预训练中。(实验设置:§2.1;表 1;图 2 展示了一次读出结果。)共有三项结果。监督信号实现了迁移:在指定内容上,使用新探针在特定位置测得的 AUC 达到 0.95–1.00,而对照组基线为 0.77–0.80。大规模场景下,独立审计至关重要:朴素的存在性检测头在最小化其训练损失的同时,却无法让新探针解码出任何信息(详见附录)。对于稀有目标,检测头可以通过始终预测“不存在”来获得高分,这种捷径只有独立探针才能暴露。通过按类别频率平衡损失,可以在两种剂量下堵住这一捷径(全部 512 个目标的 AUC 达到 0.97–0.99)。设计原则是:必须使用那些不经过真正的区分就无法最小化损失的目标。可解码性代价取决于目标设计。在有效设计下,64 个目标的代价为 nats(配对 95% 置信区间 ,各 3 个随机种子),这落在 0.06 nat 的种子波动范围内,与零无显著差异。当目标数增加到 512 个时,代价上升至 – nats。一个具有区分性的身份目标在 (全权重的三十三分之一)时仍保持可解码,且其代价在噪声范围内为零。在所有八次有监督运行中,从未被指定的探针桶始终处于对照组水平。
可解码性对检测头容量和接入层选择也具有鲁棒性:一个非线性(MLP)检测头在第 6 层即可达到 0.98–0.99 的指定探针 AUC,而一个线性检测头在第 9 层可将 AUC 从 0.77–0.79(对照组)提升至 0.95–0.98,代价为 nats。完整的权重扫描以及程序中变化的其他因素(拉拽强度、指定剂量、重对齐映射类别、评估器、领域、检测头容量、接入层)及其对应结果均已收录在技术附录中。
5.4 大规模语言化审计
传播现象首次获得了真实模型层面的证据。一个按照所发布配方结构训练的 AV/AR 对,在这些触点上接受了精确自监督真值检验。它在 RECAP 模型上对上下文词语的真实陈述率为 0.44,而对照组仅为 0.06(触点聚类 bootstrap 95% 置信区间分别为 0.39–0.51 与 0.04–0.09)。对照组在规模上复现了“有依据但虚假”的特征:陈述词语的有依据率为 0.48,但真实率仅为 0.06。RECAP 将这一“有依据减去真实”的差距缩小了,但并未消除:在规模上,内容被更真实地陈述,但并非完全无编码。真实率提升并非单纯的选择性所致:在共享的现存内容词语集(400 个触点中共 381 个)上,RECAP 恢复了更多此类词语(召回率 0.29 对比 0.07),同时每次解释陈述的词语更少(0.63 对比 1.02)。该差距对重构器强度具有鲁棒性:一个信号更强的重构器(0.30)使 RECAP 在真实率(0.57 对比 0.15)和召回率(0.47 对比 0.04)上均保持领先。对照组陈述的词语更少(92 对比 312),但两项指标仍落后。在三个 RECAP 目标模型种子(每个种子对应一个全新的 NLA,即三个 NLA 用于 RECAP 模型,三个用于对照组)上,陈述词语的真实率保持稳定(0.44–0.46,对照组为 0.00–0.07)。
然而,语言化器仅传达了激活状态所包含内容的一部分,这种不足是生成过程的属性,而非存储过程的属性。在语言化器自身的召回层面上,对同一“抽头”进行新的探针检测可达到精确度,而语言化器自身在不同重构器和随机种子下的精确度为 0.44–0.63(精确度-召回率图见附录)。我们将这一不足定位到生成过程本身。我们重新设计了重构器:标准化的多 token 注入、MLP 容量,以及一个基于精确窗口出现事实(外部标签,而非学习得到的监控器)训练的解码点存在性检测头。这使得指定内容能够从其自身的解码点隐藏状态中以 0.79–0.81 的精确度(两个随机种子)进行线性解码。然而,同一重构器的生成精确度仍保持在 0.56–0.63。在相同的检测头下,匹配对照组的解码点状态读取结果仅为随机水平(0.03),因此可解码的内容属于 RECAP,而非检测头本身。无论是重构器规模、重构优化、直接的真实奖励、注入带宽,还是显式的负向监督,都无法弥合这一差距(3B 重构器与 0.5B 重构器表现相当)。在规模上,RECAP 的保证是可解码性:指定内容存在且可通过探针验证。重构族语言化器仅能将其部分转化为文本。因此,自由形式的解释是对激活状态所包含内容的有损呈现,而我们基于探针的监控器通过验证内部状态来核实声明,而非信任文本本身。(偏移量为 8 的目标不会传播,但其真实 token 仅在 2.2% 的抽头中作为指定槽位出现,数量过少难以表征;我们将其报告为未恢复,而非作为代码。)
可解码性是一种持续运行的成本,而非一次性设置:它在无头微调后的几百步内就会退化,必须持续(以 nats 为单位)或间歇性地(以约十分之一的计算量)进行维护,因此最好从一开始就进行训练,而非事后恢复(见附录)。
6 基于探针的监控
我们通过审计员现在能够验证的内容来衡量 RECAP 的价值。我们在沙盒中构建了最简单的监督工具:每个槽位的新探针读取触发激活状态,言语化器输出槽位值,任何与置信探针()相矛盾的声明都会被标记为候选差异。然后,真实标注数据对检测器进行评分(完整协议及各阶段计数见附录)。
在标准目标模型上,检测器结果可靠但召回率较低。每个标记都是真实的虚假声明(零误报),但大多数触发前的声明出现在解码能力过低的槽位中,无法进行置信读取,因此仅捕获了 733 条中的 27 条。在 RECAP 目标模型上,结果发生了逆转:不再存在触发前的虚假声明,弃权率降至零,因此每条声明都通过内部状态进行验证,而非盲目信任。指定触发前内容的验证覆盖率从 37% 提升至 100%;这一提升体现在指定内容的覆盖率上,而非检测器的精确度,且该覆盖率并不扩展至整个激活状态。两个目标模型上的触发后声明均被正确弃权,因为激活状态明显缺失的内容无法通过读取来判定。捕获这些内容由接地交叉负责;两种工具分工完成审计(一个领域、一个种子、一个阈值;完整协议见附录)。
该监控器可扩展至真实模型。在 Pythia-160M 上,新的存在性探针对真实声明与虚假声明进行排序,AUC 为 对比对照组的 ( 置信区间 和 ,672 条保留声明;区间不重叠)。它还能以 的召回率和 的精确度标记虚假声明,标记阈值基于独立的校准划分设定。因此,RECAP 不仅改善了探针的读取能力,还提升了其对言语化器的监控效果。在大规模场景的基础比率下,沙盒中每条声明的置信覆盖率指标无法直接迁移,因此我们转而报告检测器 AUC 以及标记的精确率-召回率点。言语化器提出声明,探针进行验证:在大规模场景下,探针(而非自由形式的解释)才是可靠的读取方式,这与训练模型使其内容可被核查而非依赖文本表述的原则一致。
该监控器能够抵御对手操纵评分的行为。
一个信任重构分数的部署方案将暴露于报告空间中的对抗者:将诚实解释中一个真实陈述的词编辑为一个不存在的词,选择能使重新计算的分数最大化的编辑方式(完整协议和阶梯结构见技术附录)。在分数最优的编辑下,两个模型上的谎言惩罚几乎消失:对于陈述的真实词,最优谎言仅降低(置信区间),而随机谎言则降低87%,即抑制了87%。然而,外部真实激活探针在RECAP模型上仍能以AUC(召回率)标记出谎言,而在对照模型上则降至随机水平(AUC,召回率)。因此,这种存活能力是RECAP可解码内容所特有的。对照探针也能读取报告空间对抗者无法触及的激活信号,但却失败了:读取可编辑报告之前存在的信号是必要条件但非充分条件;内容还必须可解码,这正是RECAP所提供的。选择泄露虽可见但影响较小(随着分数最优的不存在词在语义上更接近,RECAP探针在对抗阶梯上从AUC漂移至),因此,在报告空间威胁模型(而非激活级攻击,Bailey等人,2024)下,对分数操纵具有结构性免疫,对候选选择具有经验性免疫。即使是一个假设监控器泄露(超出我们的威胁模型)的探针感知型选择对抗者,也只能将RECAP监控器降至AUC,同时将对照模型驱动至随机水平以下(白盒选择攻击的预期特征)。这种差异随对抗者强度增大而扩大。因此,部署的分数不得用作针对此类对抗者的真实信号;而基于RECAP可解码内容的探针则可以。该精度工作点并非在评估集上调整:在不相交的分割集上重新校准标记阈值,召回率基本保持不变(冻结版本与评估调优版本相比),且即使针对随机谎言,也没有任何对照探针阈值能达到精度。该效应也仅限于指定内容:在模型从未被训练保持可解码的保留词汇带(排名64-128的词)上,RECAP监控器相比对照模型无优势(诚实情况AUC与对比,阶梯内臂差距,检测差距的统计功效达到)。因此,指定既是该效应的机制也是其范围(完整协议和词汇带表见附录)。
7 相关工作
激活值语言化及其批评。
除了 NLA 方案(§2)(Fraser-Taliente 等人,2026)之外,一个快速发展的家族改进了读取器:有监督的问答解码器(Pan 等人,2026)、通用激活值解释器(Karvonen 等人,2025;Bauer 等人,2026)、解释器助手(Huang 等人,2025)、无需训练的读出器(Ghandeharioun 等人,2024)以及跨模型适配器(Zhao 等人,2026)。稀疏自编码器属于无监督读取器家族(Huben 等人,2024);过时性适用于任何冻结的读取器。模型生成的解释通过了合理性检查,但在思维链中缺乏忠实性(Turpin 等人,2023;Lanham 等人,2023);对神经元解释的因果测试发现了高错误率和低有效性(Huang 等人,2023);反事实忠实性测试预示了我们的翻转协议(Atanasova 等人,2023)。现有对语言化的批评停留在基准层面:许多任务无需目标模型的内部信息即可解决(Li 等人,2025)。我们在两个维度上有所不同:我们审计测试本身(针对每个声明,以反事实方式,在已发布的系统上),并且我们的修复训练的是目标模型,而非更好的读取器。
学习通道中的隐写术。
自 CycleGAN(Chu 等人,2017)以来,重建族目标函数一直将其信息隐藏在通道中。在大语言模型中,编码推理在优化压力下(Roger 和 Greenblatt,2023)出现于思维链中,并在过程监督下(Skaf 等人,2025)泛化。错误指定的激励会导致隐写式共谋(Mathew 等人,2025),工具使用拓宽了通道(Rippin 等人,2026),而探测内部状态可检测共谋(Rose 等人,2026)。优化可以混淆激活值以对抗潜在监控器(Bailey 等人,2024),而针对思维链监控器进行训练会导致混淆式奖励黑客行为,而非诚实(Baker 等人,2025)。所有这些通道都是被诱导出来的:通过激励、过程监督或对抗性手段。我们的编码仅从标准重建方法中产生,位于可解释性流程内部,没有隐写目标或通信奖励。当那些工作规定不要对监控器进行优化时,我们展示了一条互补的路径:根据外部真实情况监督目标模型,使其内容可解码,而无需迫使它欺骗探针或重建器。
表征漂移、拼接与监控器陈旧性。
网络学习到的等价表征可相差一个变换(Lenc 和 Vedaldi,2015;Kornblith 等人,2019;Moschella 等人,2023);仿射映射可跨语言模型迁移特征(Chen 等人,2025);预训练动态在不同随机种子间是稳定的(van der Wal 等人,2025);调谐透镜正是我们表征其陈旧性的仿射读取器(Belrose 等人,2023)。与此同时,Duan(2026)报告了在 20 亿和 70 亿参数模型上相同的陈旧性与无标签修复,这是部署规模上的汇聚证据;在针对探针感知的微调之后,重新训练探针也能恢复可检测性(Wehner 和 Fritz,2025)。我们的新增贡献包括:恢复机制剖析(第 4 节)、跨随机种子失败、信息寿命超过其读取器的确切证据,以及漂移与崩溃的区分。
深度监督与内在可解释性。
在隐藏层上添加辅助头属于深度监督(Lee 等人,2015;Szegedy 等人,2015);其目标是任务标签;而我们的目标是保持可解码性的外部内容。概念瓶颈将所有信息流路由至命名概念(Koh 等人,2020;Sun 等人,2025),概念白化约束了几何结构(Chen 等人,2020),码本特征对表征进行离散化(Tamkin 等人,2023),梯度路由定位计算过程(Cloud 等人,2024);我们则添加了线性头,且不约束信息流。解释侧监督可以追踪行为变化(Guo 等人,2026);而我们的监督位于目标模型侧。
8 讨论与局限性
范围与局限性。我们的证据来自一个合成沙箱、一个已发布的 NLA(Qwen-2.5-7B),以及对一个小模型(Pythia-160M)的持续预训练,且大多基于单一种子;前沿规模尚未经过测试。四个局限性制约了我们的结论。第一,我们的沙箱和规模审计仅覆盖封闭词汇、模板解析的声明,且监控器仅覆盖指定内容;开放式的忠实度尚未被衡量。第二,RECAP 必须协同训练,无法事后应用于冻结模型,且其效果依赖于选择良好的目标:选择不当的目标可能在解码不到任何内容时仍报告成功。第三,可解码性不等于可语言化:内容可通过探针解码,但自由形式的语言化器仅能传达其中一部分,因此探针是更可靠的读取方式。第四,RECAP 认证的是激活值存储了什么,而非模型使用了什么:指定内容可能存在且可检查,但在行为上却毫无影响(接入该监测点几乎不改变行为),并且模型可能绕开被监测的子空间进行运算(Mahinpei 等人,2021;Margeloiu 等人,2021)。
经过重建测试的语言化成功,意味着其具体声明能够针对目标模型得到验证,在内容缺失时能够进行校准后的弃权,并且监控器具备重新校准协议,而非追求更高的(指标)。
9 结论
我们对自然语言激活解释背后的重构测试进行了审计。该测试通过要点摘要和私有编码得以通过,而针对该测试的训练会导致模型崩溃或代理作弊,而非忠实性。在我们的控制条件下,能够存活的修复方法是 RECAP:训练目标模型,而非读取器。该方法在沙箱环境中生成了声称忠实的语言化器(5/5 次运行),并在 Pythia-160M 上使指定内容可通过探针解码,其中一个新的语言化器以 0.44–0.46 的准确率(三个目标模型种子;使用更强的重构器时可达 0.57)真实地陈述该内容,而对照组则接近零。在沙箱中,基于探针对指定内容的审计覆盖率从 37% 提升至 100%;在大规模测试中,一个探针以 AUC 0.965 对比 0.823(95% 置信区间不重叠)对语言化器的真实声称与虚假声称进行排序,其读取内容的可靠性高于语言化器生成内容的可靠性。总体方法论启示是:对模型自身解释的学习性测试可能被该模型所利用。因此,将可解码性训练进目标模型,比事后审计已训练好的模型更为可靠。
参考文献
- P. Atanasova, O. Camburu, C. Lioma, T. Lukasiewicz, J. G. Simonsen, and I. Augenstein (2023) 自然语言解释的忠实性测试. 收录于 ACL, 注: arXiv:2305.18029 被引于: §7.
- L. Bailey, A. Serrano, A. Sheshadri, M. Seleznyov, 等人 (2024) 混淆激活绕过LLM潜在空间防御. arXiv 预印本 arXiv:2412.09565. 被引于: §6, §7.
- B. Baker, J. Huizinga, L. Gao, Z. Dou, M. Y. Guan, A. Madry, W. Zaremba, J. Pachocki, and D. Farhi (2025) 监控推理模型的不当行为及促进混淆的风险. arXiv 预印本 arXiv:2503.11926. 被引于: §7.
- J. Bauer, C. De Schamphelaere, A. Karvonen, N. Luick, and N. Nanda (2026) 构建更好的激活神谕. arXiv 预印本 arXiv:2606.02609. 被引于: §7.
- N. Belrose, I. Ostrovsky, L. McKinney, Z. Furman, L. Smith, D. Halawi, S. Biderman, and J. Steinhardt (2023) 使用调谐透镜从Transformer中引出潜在预测. arXiv 预印本 arXiv:2303.08112. 被引于: §7.
- S. Biderman, H. Schoelkopf 等人 (2023) 《Pythia:一套用于分析大语言模型训练与扩展过程的工具集》。收录于国际机器学习大会(International Conference on Machine Learning),引用自:§2.1。
- A. Chen, J. Merullo, A. Stolfo 和 E. Pavlick (2025) 《通过模型拼接在不同语言模型间迁移线性特征》。arXiv 预印本 arXiv:2506.06609。引用自:§7。
- X. Chen 和 K. He (2021) 《探索简单孪生表示学习》。收录于 CVPR,引用自:§4。
- Z. Chen, Y. Bei 和 C. Rudin (2020) 《用于可解释图像识别的概念白化》。Nature Machine Intelligence 2,第 772–782 页。引用自:§7。
- C. Chu, A. Zhmoginov 和 M. Sandler (2017) 《CycleGAN,隐写术大师》。收录于 NIPS 机器欺骗研讨会(NIPS Workshop on Machine Deception),注:arXiv:1712.02950。引用自:§7。
- A. Cloud, J. Goldman-Wetzler, E. Wybitul, J. Miller 和 A. M. Turner (2024) 《梯度路由:通过掩码梯度来定位神经网络中的计算》。arXiv 预印本 arXiv:2410.04332。引用自:§7。
- E. Duan (2026) 《激活监控能否在模型更新后存活?对激活监控过时性的基准测试、预测与修复》。arXiv 预印本 arXiv:2606.15980。引用自:§4, §7。
- K. Fraser-Taliente, S. Kantamneni, E. Ong, D. Mossing, C. Lu 等人 (2026) 《自然语言自编码器生成大语言模型激活的无监督解释》。注:Transformer Circuits Thread,transformer-circuits.pub/2026/nla。引用自:图 1, §1, §2.1, §7。
- L. Gao, S. Biderman, S. Black 等人 (2020) 《The Pile:一个 800GB 的多样化文本语言建模数据集》。arXiv 预印本 arXiv:2101.00027。引用自:图 2。
- A. Ghandeharioun, A. Caciularu, A. Pearce, L. Dixon 和 M. Geva (2024) 《Patchscopes:一个用于检查语言模型隐藏表示的统一框架》。收录于 ICML,引用自:§7。
- Z. C. Guo, L. Ruis, J. Andreas 和 B. Z. Li (2026) 《内省耦合:在固定监督下,自我解释训练追踪行为变化》。arXiv 预印本 arXiv:2606.32038。引用自:§7。
- J. Huang, A. Geiger, K. D’Oosterlinck, Z. Wu 和 C. Potts (2023) 《严格评估神经元的自然语言解释》。收录于第 6 届 BlackboxNLP 研讨会论文集(Proceedings of the 6th BlackboxNLP Workshop),第 317–331 页。注:arXiv:2309.10312。引用自:§7。
- V. Huang、D. Choi、D. D. Johnson、S. Schwettmann 和 J. Steinhardt(2025)《预测性概念解码器:训练可扩展的端到端可解释性助手》。arXiv 预印本 arXiv:2512.15712。引用于:第 1 节、第 7 节。
- R. Huben、H. Cunningham、L. Riggs Smith、A. Ewart 和 L. Sharkey(2024)《稀疏自编码器在语言模型中发现高度可解释的特征》。发表于 ICLR,备注:arXiv:2309.08600。引用于:第 7 节。
- A. Karvonen、J. Chua、C. Dumas、K. Fraser-Taliente、S. Kantamneni 等人(2025)《激活预言:训练和评估大语言模型作为通用激活解释器》。arXiv 预印本 arXiv:2512.15674。引用于:第 1 节、第 7 节。
- P. W. Koh、T. Nguyen、Y. S. Tang、S. Mussmann、E. Pierson、B. Kim 和 P. Liang(2020)《概念瓶颈模型》。发表于 ICML。引用于:第 7 节。
- S. Kornblith、M. Norouzi、H. Lee 和 G. Hinton(2019)《重新审视神经网络表示的相似性》。发表于 ICML。引用于:第 7 节。
- T. Lanham、A. Chen、A. Radhakrishnan、B. Steiner 等人(2023)《衡量链式推理中的忠实度》。arXiv 预印本 arXiv:2307.13702。引用于:第 7 节。
- C. Lee、S. Xie、P. Gallagher、Z. Zhang 和 Z. Tu(2015)《深度监督网络》。发表于 AISTATS。引用于:第 5.1 节、第 7 节。
- K. Lenc 和 A. Vedaldi(2015)《通过测量等变性和等价性来理解图像表示》。发表于 CVPR。引用于:第 7 节。
- M. Li、A. M. Ceballos Arroyo、G. Rogers、N. Saphra 和 B. C. Wallace(2025)《激活言语化方法是否传达了特权信息?》。arXiv 预印本 arXiv:2509.13316。引用于:第 7 节。
- A. Mahinpei、J. Clark、I. Lage、F. Doshi-Velez 和 W. Pan(2021)《黑盒概念学习模型的承诺与陷阱》。arXiv 预印本 arXiv:2106.13314。引用于:第 8 节。
- A. Margeloiu、M. Ashman、U. Bhatt、Y. Chen、M. Jamnik 和 A. Weller(2021)《概念瓶颈模型是否按预期学习?》。arXiv 预印本 arXiv:2105.04289。引用于:第 8 节。
- Y. Mathew、O. Matthews、R. McCarthy、J. Velja、C. Schroeder de Witt、D. Cope 和 N. Schoots(2025)《隐藏在明文之中:大语言模型中隐写共谋的出现与缓解》。发表于 IJCNLP-AACL,备注:arXiv:2410.03768。引用于:第 7 节。
- L. Moschella、V. Maiorca、M. Fumero、A. Norelli、F. Locatello 和 E. Rodolà(2023)《相对表示实现零样本隐空间通信》。发表于 ICLR,注:arXiv:2209.15430,被 §7 引用。
- A. Pan、L. Chen 和 J. Steinhardt(2026)《LatentQA:教大语言模型将激活值解码为自然语言》。发表于 ICLR,注:arXiv:2412.08686,被 §1、§7 引用。
- G. Penedo 等人(2024)《FineWeb 数据集:从网络中提取最优质文本数据》。arXiv 预印本 arXiv:2406.17557,被附录 C 引用。
- Qwen 团队(2025)《Qwen2.5 技术报告》。注:arXiv 预印本 arXiv:2412.15115,被 §2.1 引用。
- J. L. Rippin、S. C. Marshall、D. D. Africa 和 C. Schroeder de Witt(2026)《工具使用使多智能体大语言模型系统实现不可检测的隐写术》。arXiv 预印本 arXiv:2606.28425,被 §7 引用。
- F. Roger 和 R. Greenblatt(2023)《防止语言模型隐藏其推理过程》。arXiv 预印本 arXiv:2310.18512,被 §7 引用。
- A. Rose、C. Cullen、S. Abdelnabi、P. Torr、B. G. Kaplowitz 和 C. Schroeder de Witt(2026)《通过多智能体可解释性检测多智能体合谋》。arXiv 预印本 arXiv:2604.01151,被 §7 引用。
- J. Skaf 等人(2025)《大语言模型能在过程监督下学习并泛化隐写式思维链》。arXiv 预印本 arXiv:2506.01926,被 §7 引用。
- C. Sun、T. Oikarinen、B. Ustun 和 T. Weng(2025)《概念瓶颈大语言模型》。发表于 ICLR,注:arXiv:2412.07992,被 §7 引用。
- C. Szegedy、W. Liu、Y. Jia、P. Sermanet 等人(2015)《用卷积走向更深》。发表于 CVPR,被 §5.1、§7 引用。
- A. Tamkin、M. Taufeeque 和 N. D. Goodman(2023)《码本特征:神经网络的稀疏离散可解释性》。arXiv 预印本 arXiv:2310.17230,被 §7 引用。
- Y. Tian、X. Chen 和 S. Ganguli(2021)《理解无对比对的自监督学习动态》。发表于 ICML,被 §4 引用。
- M. Turpin、J. Michael、E. Perez 和 S. R. Bowman(2023)《语言模型并不总是说出真实想法:思维链提示中的不忠实解释》。发表于 NeurIPS,注:arXiv:2305.04388,被 §7 引用。
- O. van der Wal、P. Lesci、M. Müller-Eberstein、N. Saphra、H. Schoelkopf、W. Zuidema 和 S. Biderman(2025)《PolyPythias:五十次大语言模型预训练运行中的稳定性与异常值》。arXiv 预印本 arXiv:2503.09543。引用自第 7 节。
- J. Wehner 和 M. Fritz(2025)《基于探针的微调方法用于降低毒性》。arXiv 预印本 arXiv:2510.21531。引用自第 7 节。
- H. Zhao、Z. He、G. Wang、A. Payani、Y. Li 和 M. Du(2026)《通用激活词化器:跨模型激活解释的统一框架》。arXiv 预印本 arXiv:2605.25903。引用自第 4 节、第 7 节。
附录 A 最小对翻转的编辑有效性
接地测量的质量完全取决于产生这些测量的编辑。一个编辑是有效的,当且仅当它恰好翻转一个主张,且不改变其他任何内容。我们在已发布的系统上审计了两个编辑生成器:一个闭源模型判断器在 68.4% 的情况下生成了有效编辑,而本文全程使用的开源判断器(Gemma-4-12B,固定修订版本,温度 0)在 99.3% 的情况下生成了有效编辑。无效编辑的主要问题是规模过大:它们重写了目标主张及其周围的材料,额外的破坏使得表观接地程度大约膨胀了七倍。因此,论文中所有接地比例均使用开源判断器,并经过逐编辑有效性过滤;正文用一句话报告了这一情况,审计产物则保留了逐主张的重建差异。同一项对比测试还测量了一种无判断器的掩码与重评分信号,与翻转工具进行对比(在经验证的判断器下,AUC 一致性为 0.997),该方法用于附录 G。
附录 B 安全性实验 1:差异检测器
问题。
如果审计员能够通过探针读取目标模型的激活状态,同时也能读取词化器的输出,那么两者之间的不一致就可能是潜在的谎言。这种检测器有多大用处?其有效性取决于什么?
实验方案。
沙盒,领域 1,种子 1,每个目标模型 400 个保留探针。对于每种槽位类型,我们在探针分割上拟合一个全新的多项逻辑斯蒂探针(线性,256 维输入),从探针激活中读取槽位值。在评估探针上,语言化器生成一个解释;每个槽位类型的第一陈述词与探针的预测进行比较。当置信度高于 0.9 的探针与陈述词不一致时,一个声明被标记为可疑;当探针置信度低于阈值时,则弃权。然后,精确的元组真实标签对每个决策进行评分。
| 模型 | 阶段 | 声明 | 虚假 | 标记 | 精确率 | 弃权 |
|---|---|---|---|---|---|---|
| 控制 | 探针前 | 1200 | 733 | 27 | 1.000 | 0.632 |
| 控制 | 探针后 | 800 | 698 | 0 | — | 1.000 |
| RECAP | 探针前 | 1200 | 0 | 0 | — | 0.000 |
| RECAP | 探针后 | 800 | 706 | 0 | — | 1.000 |
发现。
(i) 检测器在其可作用的任何地方都是可靠的:所有 27 个标记都是真正的虚假声明(任何地方零误报)。(ii) 其瓶颈在于目标模型的可解码性,而非检测器质量:在控制目标模型上,63% 的探针前声明落在因过于模糊而无法进行可靠读出的槽位中,因此在 733 个谎言上的召回率为 3.7%。(iii) 在 RECAP 目标模型上,探针前的谎言问题在源头消失(1,200 个声明中 0 个虚假声明,与传播结果一致),弃权率降至 0%:审计者的状态从“无法检查大部分内容”变为“已验证全部内容”。(iv) 两个目标模型上的探针后声明均为 100% 弃权,这是正确的,因为激活中可证明缺失的内容无法通过读取激活来裁决;捕捉这些虚构内容是接地交叉验证的工作。正文中使用的一行总结是:验证覆盖率受限于可解码性,而 RECAP 将探针前覆盖率从 37% 提升至 100%。
注意事项。
一个领域,一个种子,一个阈值(0.9);“可解码”意味着在整个过程中可线性读取。
附录 C 安全实验 2:无头微调下的可读性持久性
问题。
在真实的后训练流程中,丢弃探测头之后,RECAP 训练出的可解码性是否能在后续训练中存活下来?
实验协议。
从 RECAP Pythia-160M 检查点(类别平衡存在,)和对照检查点出发,我们仅使用语言建模损失(无探测头)在 1.31 亿个 token 的刻意偏移语料库(FineWeb(Penedo 等人,2024),与 Pile 训练分布不同)上对两者进行微调。训练使用批次大小、学习率,共 2000 步,并在 250/1000/2000 步处保存快照。每个快照都使用标准的新探测头流程重新探测:岭回归探测头在不相交的保留序列块上进行拟合和评估,因此测量结果在设计上不受读取器过时的影响:探测头在每个快照处重新拟合,从不向前沿用。
| RECAP 运行 | 对照 | |||||
|---|---|---|---|---|---|---|
| 步数 | b1 / b2 | 身份 | b4 | b1 / b2 | 身份 | |
| 0 | .983 / .992 | .991 | .808 | .768 / .796 | .115 | |
| 250 | .827 / .849 | .320 | .805 | .769 / .795 | .151 | |
| 1000 | .806 / .823 | .180 | .810 | .771 / .795 | .118 | |
| 2000 | .789 / .812 | .169 | .802 | .770 / .793 | .136 | |
发现。
RECAP 的大部分优势在 250 步内消失,并在 2000 步时接近对照基线(仍残留微小优势)。对照运行和从未指定的桶在整个过程中保持平稳,因此衰减是特定于指定内容的。由于探测头在每个快照处重新拟合,这是可解码性损失(线性可解码性本身消失),这严格强于漂移结果中冻结读取器的过时性:在漂移结果中,信息持续存在,重新对齐可以恢复它;而在这里,新探测头失去了访问能力。部署规则:RECAP 是一项持续成本,而非一次性购买;扫描成本使其持续运行在 nats(配对 95% CI,各 3 个种子)下。
后续运行。
另外两次实验解答了显而易见的疑问。在对未见同分布数据(与训练集、验证集或探针数据无重叠的新鲜 Pile 文本)进行无预测头微调时,可解码性以相同方式下降(第 2000 步时 b1/b2/ident 与移位后结果一致),因此这种下降是移除预测头本身导致的,而非语料偏移效应。如果在移位微调过程中每十步应用一次预测头损失,则可保留大部分可解码性(第 2000 步时约稳定在第 250 步的水平),因此以十分之一频率进行间歇监督即可获得大部分保护效果。原始训练日志还显示,可读性建立缓慢(第 400 步时身份损失接近随机水平),因此事后建立可读性是一项艰巨任务,而非快速修复:维护优于恢复。
注意事项。
每次实验仅使用单一随机种子;共 2000 步;间歇运行的语言建模代价未单独测量(此处讨论的是监督频率问题)。
附录 D 合成领域
两个沙盒领域均基于封闭词汇的模板化语法:通过为每个槽位采样一个值,并用随机填充句格式化固定模板来生成故事,因此每个故事都有精确的真实元组,且所有审计指标无需评判者即可计算。
领域 1(故事)。
五个槽位:姓名(20 个值)、地点(12 个)、物品(12 个)、活动(8 个)、结局(8 个)。姓名、地点和物品在触发点之前提及;活动和结局仅在触发点之后出现。触发句为固定文本,因此触发点在每个故事中的 token 偏移位置相同。槽位设计决定了触发激活可能包含的内容:姓名在触发点后被重复使用(目标模型必须将其跨过触发点保留);地点和物品在触发点前结束(已衰减);活动和结局从未出现在触发点之前(未读取,可证明不存在,作为不可能性控制)。
领域 2(市场)。
一个用于外部效度的结构偏移域:五个不同大小的词汇表(顾客 20、商店 10、物品 14、支付 6、结果 10),每个故事有两种模板变体,以及一个可变的标记位置(标记前取决于模板的填充长度)。顾客、商店和物品位于标记之前;支付和结果位于标记之后。流程中的其他所有内容都是域参数化的,且保持不变。
| 域 1(故事) | 域 2(市场) | |
| 槽位(标记前/后) | 3 / 2 | 3 / 2 |
| 词汇表大小 | 20/12/12/8/8 | 20/10/14/6/10 |
| 模板 | 1 | 2 |
| 标记位置 | 固定 | 可变 |
目标模型是 8 层 Transformer,在 120,000 个故事上从头训练;标记在第 4 层(共 8 层)被读取。域 2 的目标模型达到了与域 1 相同的训练困惑度(1.304),并且涌现记录中的每一个现象都在域间迁移(表 5)。
| 现象 | 域 1 | 域 2 | 总计 |
|---|---|---|---|
| 编码,标准 | 3/3 | 2/2 | 5/5 |
| 编码,RECAP(5 个种子) | 0/3 | 0/2 | 0/5 |
| 编码,RECAP 剂量(种子 1) | 0/3 | — | 0/3 |
| RECAP 上限 1.0 | 3/3 | 2/2 | 5/5 |
| 传播 | 3/3 | 2/2 | 5/5 |
图 3 展示了一个代表性的保留故事,以及标准和 RECAP 目标模型生成的解释。
附录 E 已发布系统审计详情
设置。
所有已发布系统的测量均使用公开的 Qwen-2.5-7B 第 20 层 AV/AR 对,在分布内网络文本上进行,采用贪婪解码和仅方向重构。最小对编辑来自一个固定修订版本的开放评判器,并经过每个编辑的有效性过滤(附录 A);每个声明的重构增量都被持久化( 基础系统声明)。
| 变体 | |||
|---|---|---|---|
| 基础 | 0.042 | 0.021 | 0.016 |
| RAFT | 0.046 | 0.025 | 0.017 |
| RL | 0.042 | 0.020 | 0.014 |
各落地比例(上表)在阈值上保持稳定,且训练变体在每个阈值下均落在基础系统的自助法区间内。基础系统自助法95%区间在 下分别为3.2–5.2% / 1.5–2.9% / 1.0–2.2%。翻转噪声基底低于最小阈值: 的第95百分位数为0.017,且错误方向下降 在经验零假设下以 速率发生。可解码性上限:输入细节从单位置残差向量解码时,在读取层经机会校正后为 ,该数值在第16–27层及所有前缀位置上保持不变;均值池化时要点解码可达50%。我们评估的最强训练读取器(重构族AR本身)未超过岭回归上限。范围:这些上限数字仅约束重构类读取器;模型自身的解嵌入层以下一token形式(下文量化)看到后期层细节。
工具有效性控制。
三项控制验证了审计工具本身(598个分布内段落,位置 )。基底:针对不匹配激活的重构给出平均中心化余弦为 ,因此 中的基底归一化已校准,不匹配对坍缩至随机水平。输入回响:解释在 下针对原始输入前缀和改写前缀重构其激活,得分分别为 和 ,因此解释携带的信号远超对输入的复述(重构器对解释风格文本的特化仅解释了部分差距,而非主要部分)。变换特征(表7):得分在保留意义的改写后保持不变,在内容词被掩码时坍缩,这是意义层面解码的特征;表层形式编码会呈现相反模式。这是直接证据表明,承载已发布系统得分的是要点而非措辞。
| 变换 | 保留比例 | |
|---|---|---|
| 无(原始) | 0.84 | 1.00 |
| 改写 | 0.75 | 0.89 |
| 同义词替换 | 0.70 | 0.83 |
| 掩码功能词 | 0.72 | 0.85 |
| 词序打乱 | 0.32 | 0.37 |
| 掩码内容词 | 0.04 | 0.04 |
后期层清单。
对于每个被审计的虚假声明,若其具有一个干净的单 token 真实值(),我们在每层的两种读出方式中对该值进行排序:模型自身的 logit lens(最终归一化 + 反嵌入)以及一个容量匹配的文档折叠岭探针(表8)。模型自身的读出在第27层将遗漏值排入词汇表前50名的可能性是读出层的17倍(从0.6%到10.1%),而通用训练探针则保持平稳,因此后期层信号存在于模型自身的输出基中。因此,读取更靠后的层是一个真实但有限的杠杆:恢复率峰值接近10%,因此大多数遗漏的具体信息无法通过上述读出方式在模型堆栈的任何位置恢复。我们按输出位置(嵌入层为0)对隐藏状态进行索引,因此第20层的接入点在表8中对应索引21;可解码性扫描(16–27层)使用相同的索引。
| 层 | logit-lens 前50名 | 岭探针 前50名 |
|---|---|---|
| 15 | 0.000 | 0.054 |
| 21(读出层) | 0.006 | 0.047 |
| 24 | 0.035 | 0.044 |
| 26 | 0.073 | 0.051 |
| 27 | 0.101 | 0.060 |
一个控制设计方面的教训。
上限探针的负控制(针对不同文档的激活值对探针进行评分)最初因偏移一行而高于随机水平,达到0.163,这是因为相邻行通常是同一文档的两个位置,编码了相同的具体信息;将偏移量设为数据集的一半后,结果恢复为精确的随机水平。我们报告这一点,是因为近似重复的控制项很容易让此类审计工作自我感觉良好。
附录F 对抗性监控器:谎言阶梯
问题。
如果部署方将重建分数视为真实信号,那么一个报告空间的对手能否通过编辑解释来最大化让虚假声明蒙混过关,而激活探针监控器能否抵御该对手?
协议。
对 Pythia-160M 进行 RECAP 与控制(平衡)。在保留的测试集上,我们取诚实表述生成器,并针对每个陈述词,将其编辑为一个不存在的 top-64 词(一种真实到不存在的谎言)。然后我们通过真实重构器对编辑后的文本重新计算,并使用外部真相存在探测模型(在训练集上训练,从未使用过表述生成器的输出)对谎言进行评分。对抗强度递增的层级:L1 随机选择一个不存在的词;L2 选择嵌入向量最近的不存在词;L3 针对每个声明,在所有候选词中选择最优的不存在词(编辑族中最强的博弈型谎言);以及作为威胁模型之外的最坏情况边界,L4 采用一种感知探测模型的对抗方法,假设私有监控器泄露,并在诚实范围内选择探测模型最可能误判为存在的谎言。预算设置为最强纯分数型谎言(L3)分数成本的两倍以上,因此 L4 是刻意宽松、保守的边界,而非经过调校的容差。解耦设计(正面:任何真实存在的词;编辑槽位:表述生成器所陈述的词),使得两个分支都有足够的能力:RECAP,控制;诚实/。基于编辑,无需强化学习。
| 对抗层级 | RECAP AUC / 召回率 | 控制 AUC / 召回率 |
|---|---|---|
| L1 随机 | 0.993 / 0.99 | 0.729 / 0.06 |
| L2 嵌入向量最近 | 0.971 / 0.93 | 0.635 / 0.06 |
| L3 最优 | 0.952 / 0.86 | 0.508 / 0.01 |
| L4 感知探测模型* | 0.909 / 0.70 | 0.242 / 0.00 |
发现。
(i) 在 L3 层级几乎已被攻破:对于一个给定的真实词,最优谎言仅能抑制随机谎言所引发惩罚的 87%(RECAP,置信区间)。(ii) RECAP 探针仍保持区分能力(AUC 0.952),而对照探针仅处于随机水平(0.508):稳健的监控要求内容可被解码,这正是 RECAP 所提供的;仅仅将探针置于读取早于可编辑报告的信号位置是不够的。(iii) 选择泄漏很小(RECAP AUC 沿层级下降):对分数操纵具有结构性免疫,对候选选择具有经验性免疫。(iv) 一个知晓探针的选择对抗者(L4 层级,在威胁模型之外,假设监控泄漏)仅将 RECAP 降至 AUC(召回率),而对照探针则降至随机水平以下;该低于随机水平的值是白盒攻击的预期特征,即选择这个弱对照探针过度评分的缺失词,并非异常。因此,对抗者越强,RECAP 与对照探针之间的差距就越大(L1 层级为某值,L4 层级为某值),这与 RECAP 的探针余量吸收了对照探针所缺乏的选择压力这一结论一致。
注意事项。
报告空间对抗者;一个知晓探针的报告空间选择对抗者作为最坏情况边界(L4 层级)进行了测试。激活层面的攻击(对目标进行知晓探针的训练、输入扰动),即移动激活本身而非选择要陈述哪个词,不在本文讨论范围内(正文)。是近乎而非字面上的声明不敏感:残余效应是一种聚合效应,没有实际可用的逐实例信号。
反循环性:冻结阈值与保留频段。
由于监控探针探测的是与 RECAP 监督相同的 top-64 存在谓词,因此通过两项补充测试来检验它是否仅仅重新测量了训练后的余量(审计探针数量,在双倍条件下复现主要结论)。(a) 冻结阈值。在一个不相交的分割集上校准精确率标志阈值,得到 RECAP 召回率 L3 层级 / L4 层级,与评估调优后的结果 / 相匹配,因此操作点并非评估膨胀所致;即使针对随机谎言(L1 层级),对照探针的阈值也无法达到精确率,因此对照探针的召回率未定义,而不仅仅是数值低。(b) 保留频段。当我们监控排名 64–128 的词的存在性时(这些词从未被 RECAP 头部监督过),RECAP 的优势消失(表 10)。
| 对抗轮次 | RECAP AUC | 控制组 AUC | 差距 |
|---|---|---|---|
| L1 随机 | 0.661 | 0.702 | |
| L2 嵌入邻近 | 0.633 | 0.662 | |
| L3 最优 | 0.546 | 0.585 | |
| L4 探针感知∗ | 0.290 | 0.226 |
该词带的零假设限定于该探测层上的线性可解码性,并非该词带在模型中不存在的证据。冻结阈值是同一轮运行的互斥分割,而非时间上保留的部署阈值。该词带臂是非配对的。因此,指定既是机制也是范围:RECAP 使得关于指定内容的谎言在精度可控的工作点上可被检测,但对指定词汇之外的声明不提供任何保护。
附录 G 一种无需 API 的接地信号,以及一个选择零假设
翻转工具需要一名评判员为每条声明编写一个最小对编辑。一种更廉价的信号则无需此操作:用中性填充词掩盖声明中的词语,并用冻结重构器重新评分解释。在附录 A 的评判员对比测试中,这种掩盖-重评分信号与翻转工具在经验证的开放评判员下达到 AUC 0.997 的一致性,因此每条声明的接地情况可以在推理时通过一次额外的冻结读取器传递来监控,无需评判员参与。该实验的早期版本还报告了过滤器精度和接地基础率;这些数据依赖于验证前的翻转标签,而后续的有效性审计发现其中约三分之一因编辑过大而受到污染(附录 A)。因此,我们仅报告在经验证评判员下测得的一致性数值,并撤回其余数据。污染仅限于那些被撤回的数据:论文中保留的所有数字均在有效性过滤之后。
推理时选择所不能带来的。
由外部真实判断器进行的最佳选择(特异性匹配,独立判断器用于评估)仅将虚假声明率从 0.747(随机样本)降至 0.688:在样本邻域中,忠实解释极为罕见,因此选择无法触及它们。
附录 H 读者漂移与重新对齐
与训练目标模型匹配的读者在 1500 个持续训练步骤内(3/3 个随机种子)衰退至接近随机水平,且在不同种子间(6/6 对)无法读取任何内容。然而,信息仍然可以精确恢复:在 7000 个配对激活(无标签)上拟合的线性映射在 9/9 个案例中恢复了原生读者性能。按表达能力类别分解该映射(涉及三对读者,其中两对跨种子、一对过时):秩 1 和秩 4 映射几乎无法恢复任何内容,纯旋转(Procrustes 分析)恢复约一半,而秩 16–64 的非正交变化则恢复了几乎全部内容。崩溃则截然不同:在这种情况下,重新训练的探针也会失败,因此不存在重新对齐。
附录 I 消融索引
| 因素 | 测试条件 | 结果 | 位置 |
| 目标 | 8/64/512 | 税收增加;朴素 512 失败 | §5.3 |
| 辅助权重 | 1.0–0.03 | 在 0.03 时身份自由 | §5.3 |
| 存在性损失 | 朴素/平衡 | 平衡修复两者 | §5.3 |
| 拉取强度 | 0–10 | 在所有强度下崩溃 | §4 |
| 指定剂量 | 1–3 个槽位 | 任何剂量都能防止代码 | §5.2 |
| 重新对齐映射 | 秩 1–全秩 | 旋转一半 | 附录 H |
| 评估器 | 共同训练/独立 | 代码基础崩溃 | §3.2 |
| 领域 | 故事/市场 | 所有现象均可迁移 | §5.2 |
| 随机种子 | 3+2(沙盒) | 所有声明均可复现 | §3–5 |
| 微调持久性 | 0–2000 步 | 在 250 步内侵蚀 | 附录 C |
| 变换 | 5 种类型 | 主旨承载分数 | 附录 E |
| 读取层 | 15–27 | 前 50 恢复率 0.10 | 附录 E |
| 最佳选择 | 错误率从 0.75 降至 0.69 | 附录 G | |
| 头部容量 | 线性/MLP | 可解码性不变 | 下方 |
| 接入层 | 6 / 9 | 在 9 处复现 | 下方 |
| 读者规模 | 0.5B/3B | 真实性不变 | §5.4 |
| RAFT 轮次 | 重构奖励 | 分数上升;RECAP 持平,对照组下降 | §5.4 |
| 读者奖励 | 重构/真实性 | 两者均未提升真实性 | §5.4 |
| 注入 | 1/6 个 token | 解码点信息已恢复 | §5.4 |
| 负监督。 | 开/关 | 精度不变 | 第5.4节 |
主文中未详细说明的因素。
拉力强度(–):所有设置下均崩溃。指定剂量(1–3个槽位):任何剂量下代码均被阻止。重对齐映射类别(从秩1到全仿射):图4。评估器(联合训练 vs. 独立):独立评估器下代码基础崩溃。领域(故事 vs. 市场):所有现象均可迁移(跨领域分类账表,主文)。头部容量(, 平衡, ):非线性MLP头部在第6层达到指定探针AUC 0.98–0.99(税项 ),与线性头部持平。抽头层:第9层的线性头部将AUC从0.77–0.79(对照组)提升至 nats 下的0.95–0.98,因此可解码性并非第6层抽头所特有。未变化:超过1.6亿参数的模型规模。
辅助权重扫描()。
表12按目标类型(每个数据点单一种子)分解了规模上的可解码性代价:身份目标从 向下至 仍保持可读性,此时保留的税项在零噪声范围内,而朴素存在目标在 以下立即失去可读性。在此精度下,单一种子税项在 上呈非单调性。
| 税项(nats) | 存在 | 身份 | |
|---|---|---|---|
| 1.0 | 0.95–0.97 | 1.000 | |
| 0.3 | 0.79–0.81 | 1.000 | |
| 0.1 | 0.79–0.81 | 0.997 | |
| 0.03 | 0.79–0.81 | 0.953 |
章节编号(§)指主论文;“App.”引用指本附录的章节。单一种子因素(规模实验、安全实验)在报告处均已标注。
附录J 按规模口头化验证协议
尺度传播结果(§5.4)对一组使用已发布配方结构在 Pythia-160M taps 上训练的 AV/AR 对进行了审计。阅读器:一个 0.5B 参数的语言模型,配备 LoRA 适配器(秩 16)和一个线性维度适配器,用于将 768 维的 tap 状态映射到阅读器的嵌入宽度,激活值在标记位置进行范数匹配注入。训练:基于固定模板生成的黄金描述进行冷启动 SFT,该模板陈述了尾随窗口中的内容词以及往回数第八个位置的 token,然后交替进行重构器拟合和两轮针对重构奖励的拒绝采样。两种条件使用相同的流程;仅底层目标模型(RECAP 与控制组)不同。审计:每种条件从探测区域选取 400 个保留的 tap;解释被模板解析为陈述的上下文词和陈述的 token-at-。一个陈述的词为真,当且仅当它出现在尾随的 64 token 窗口中(精确匹配,自监督,无评判器);基础翻转将一个陈述的词替换为另一个前 64 词汇表中的词,并在协同训练的重构器下进行测量。置信区间为 tap 聚类的 bootstrap 95% 区间(对 tap 及其声明进行 10,000 次重采样):RECAP 模型为 0.385–0.506,控制组为 0.040–0.085。解析器每次解释最多输出三个声明,但此处每个 tap 最多共享两个声明,因此这些区间仅比未聚类的 Wilson 区间(0.384–0.506 / 0.042–0.089)略宽。表 13 给出了正文数字背后的完整读数。
| 指标(每种条件 400 个 tap) | 控制组 | RECAP |
| 陈述词声明数 | 406 | 252 |
| 词真实性 | 0.062 | 0.444 |
| 词在位置 @ 的接地性 | 0.48 | 0.78 |
| 词在位置 @ 的接地性 | 0.29 | 0.65 |
| 词在位置 @ 的接地性 | 0.15 | 0.47 |
| 接地性与真实性的差距 | ||
| token-at- 真实性 | 0.043 | 0.039 |
| 基于 token 的接地 @ | 0.32 | 0.43 |
| 均值 | 0.19 | 0.24 |
对重构器强度的鲁棒性。
在相同目标模型上,以更强的配置(LoRA 秩 32,更多 SFT、重构器和拒绝采样轮次)重新训练 AV/AR 对,将均值提升至 0.208(对照组)和 0.300(RECAP)。该差距在两个轴向上均保持:RECAP 陈述真实词汇的比例为 0.574 对比 0.152,并且在共享的 381 个存在词汇上,其召回率为 0.470 对比 0.037;对照组陈述的词汇更少(92 个对比 312 个),但在精确率和召回率上均落后,因此其更高的真实率源于选择性。偏移量为 8 的真实性再次接近于零(0.028/0.026),与其 2.2% 的可存储敲击基础率一致,而非代码。该结果在不同种子间也保持稳定:在三个类别平衡的 RECAP 目标模型种子上,陈述词汇的真实率分别为 0.444、0.455、0.443,而三个对照组 NLA 种子则分别为 0.062、0.060、0.000。
可解码性超过可言语化性(读取设计重构)。
为了定位语言表达器(verbalizer)所呈现的“真相”与模型内部“存储内容”之间的差距,我们首先将语言表达器置于拟合探针的精确率-召回率曲线上:在语言表达器自身的召回率水平上,探针达到了相应的精确率(指定内容 AUC 为 0.99),而语言表达器生成的精确率仅为 0.44–0.63。合理的比较对象是 AUC 与精确率之间的不匹配,而非字面上的数值差距。随后我们重建了读取器:采用标准化注入(而非逐样本的范数剥离)、通过 MLP 适配器注入六个 token、使用 MLP-LoRA,以及一个基于精确窗口出现标签(外部真实标签,绝非学习得到的监控器)训练的解码点存在性检测头。这使得指定内容可以从读取器自身在最后提示词隐藏状态下的某个位置(两个随机种子)线性读取,但其生成精确率仍保持不变;一个匹配的对照组在相同位置、使用相同的检测头进行读取。逐词置信度扫描显示,语言表达器的生成精确率-召回率曲线完全位于探针曲线下方(图 5)。我们分别尝试了读取器规模(0.5B 对比 3B)、RAFT 重建奖励、直接真实奖励、注入带宽以及显式负监督,均未能提升生成精确率,因此剩余差距与将稀疏叠加特征通过生成过程序列化所带来的代价一致,而非信息缺失所致。
附录 K 超参数与可复现性说明
规模实验(Pythia-160M)
在无版权堆栈数据集上继续预训练,每次运行处理 5 亿个 token,各次运行的数据和顺序完全相同;批次 token、AdamW 优化器(余弦退火至 10%,预热 100 步,权重衰减 0.01,梯度裁剪 1.0),采用 bf16 自动混合精度与 fp32 权重。预测头:基于第 6 层隐藏状态的线性层。存在性目标使用 BCE 损失,在 上取平均;类别平衡变体根据经验逆窗口基率对正样本加权,上限设为 100,基率从前 200 万个训练 token 中估算。身份目标使用交叉熵损失,作用于偏移量 处的前 个内容词汇。新鲜探针:在固定 下,按排名桶进行闭式岭回归,在前 80% 的保留探针序列上拟合,在后 20% 上评估(采用不相交的连续块划分;长文档可能跨越边界);身份探针为 64 类逻辑回归。早期版本曾根据评估集 AUC 从每个桶的 中选取;使用固定 完全重跑后,每个报告的桶 AUC 均能复现至小数点后三位,因此报告数据中不存在选择偏差。优化器超参数(学习率、预热步数、权重衰减、梯度裁剪)均设为标准值,未进行调优;方法专属超参数(辅助权重、目标数量 、指定剂量、接入层、预测头容量)为可变参数,其取值范围及选择规则详见消融索引。保留的语言建模损失在 2000 万个 token 上测量。显著性评估全程采用 95% 自助法置信区间和不相交区间比较(对保留频带零假设使用 Hanley–McNeil 功效分析),而非固定水平的假设检验。所有实验均在 Modal 平台上的单张 NVIDIA A100-80GB GPU 上运行(Debian-slim 系统,Python 3.12;PyTorch、Transformers、Accelerate 和 NumPy 均使用发布环境文件中锁定的精确版本)。设置过程中发现一个注意事项:近期库的默认设置会原生加载 fp16 检查点,而 fp16 模式下的 AdamW 会因 epsilon 下溢在单步内摧毁所有权重,尽管损失和梯度仍显示为有限值;所有运行均强制使用 fp32 参数。
沙盒运行。
两个合成领域(故事;市场)使用封闭词汇表;目标模型是 8 层、从头训练的 Transformer 架构;该玩具级 NLA 使用一个 0.5B 参数的 AV/AR 对,配备维度适配器、范数匹配的激活注入、基于完整故事描述的冷启动 SFT,然后交替进行重构器拟合和基于重构奖励的拒绝采样轮次(已发布配方中的结构)。审计过程通过精确的封闭词汇表扫描来解析陈述的具体内容;基础翻转操作将陈述中的一个词替换为同类型的词汇表单词,并测量重构分数的下降。RECAP 运行使用辅助权重 0.3、3000 步、批次大小 128、学习率 ,以及 30000 次探测采样。随机种子:三个(领域 1)加上两个(领域 2);每次运行由一个传递给 torch.manual_seed 的整数种子控制(并配有匹配的 CUDA 生成器用于采样),从而固定初始化、数据顺序以及随机训练和评估过程;RECAP 上限通过在领域 1 的元组不相交划分和领域 2 的保留划分上独立拟合的探测模型进行评估。