RECAP:通过可解码性监督训练可验证的激活解释

HuggingFace Daily Papers(社区热门论文)·2026-07-22 08:00·48天前
AI 导读

研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖“私密代码”而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

RECAP:通过可解码性监督训练可验证的激活解释

2026-07-22 08:00· 48天前
AI 导读

研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖“私密代码”而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。

推荐理由

这是近期可解释性领域最扎实的实证,它证明让模型自解释是危险的——重建测试会被内容和语言捷径欺骗,而训练时植入可解码性更可靠。虽仅在Pythia-160M上验证,但审计方法和思路对安全团队极为重要。

正文 · AI 翻译
摘要

自然语言自编码器通过重构来评估对隐藏激活的解释:如果激活能够从该解释中重新生成,则该解释被视为忠实。该测试在结构上对个别错误陈述不敏感:如果翻转某一陈述不改变重构结果,该陈述就永远不会受到惩罚。我们证明该测试可以通过两种方式通过,而这两种方式都不忠实。在已发布的 Qwen-2.5-7B 语言化器(verbalizer)上,解释的重构效果显著高于随机水平,但其具体陈述中仅有极少数是重构依赖的,因此该分数追踪的是输入的要点,而非其具体事实。在精确的合成真值下,标准流程在 5/5 次运行中都会发展出共适应的私有编码(重构所依赖的错误措辞),而保持目标模型不变的修复措施也无济于事。我们贡献了两种审计协议——“有依据对真值交叉检验”和“评估器互换”——以及 RECAP(通过协同训练的辅助预测器实现可读编码):与目标模型并行训练的线性头,用于保持指定内容可解码。在经 RECAP 训练的沙盒模型上,全新的语言化器能够真实地陈述指定内容,且编码消失,代价为 -nat。这一结果在预训练的 Pythia-160M 上,在我们识别出的一条目标设计规则下得以复现:内容变得可被探针可靠解码,尽管全新语言化器只能部分传达该内容(真值 0.44–0.46,而对照组接近零)。在可解释性方面,该审计为激活解释设定了陈述级证据标准:高重构分数并不能证明个别陈述为真。在 AI 安全方面,RECAP 使指定的内部内容可独立地通过探针进行核查,而非依赖模型可能学会操纵的语言化器叙述:在预训练模型上,独立探针能够可靠地将语言化器的真实陈述评分高于其错误陈述(AUC 0.96,而无 RECAP 时为 0.82),因此关于指定内容的错误陈述可通过核查探针被发现。当对手在撒谎的同时编辑解释以最大化重构分数时,它在 RECAP 模型和对照模型上都抑制了约 87% 的分数撒谎惩罚,但 RECAP 探针仍能标记出谎言(AUC 0.95),而对照探针则降至随机水平(0.51)。2%+0.001

1 引言

自然语言自编码器(NLA)让模型能够解释自身的隐藏状态:一个言语化器将激活值转换为文本解释,一个重构器将解释转换回激活值,而往返过程的质量被视为对每条解释忠实度的检验(Fraser-Taliente 等人,2026)。这一思路对监督工作颇具吸引力,因为它无需监督且具备自检能力,不需要标签或人工介入,只需为每条解释附加一个数字即可。目前已有多款开源模型发布了配套的言语化器/重构器组合,同时越来越多的方法族正在以相关目标训练激活读取器(Pan 等人,2026;Karvonen 等人,2025;Huang 等人,2025)。

该检验存在结构性缺陷。重构机制奖励的是充分性,因为解释必须包含足够信息才能重建激活值。但它不会惩罚虚假添加的内容,因为目标函数在能产生相同重构结果的声明值之间没有偏好。这种不敏感性源于目标函数本身,与模型或规模无关。

我们证明,在实践中该检验会以我们识别的两种方式被通过,而这两种方式都不属于逐条声明的忠实度。其一为“要点式通过”:在基于 Qwen-2.5-7B 的已发布 NLA 上,解释的重构效果良好,而翻转审计检测到其显著具体声明中仅有部分具备事实依据。这是一个受灵敏度限制的下界。其二为“编码式通过”:在具有精确真值标签的合成测试环境中,联合训练的言语化器/重构器组合会持续发展出私有编码:即重构所依赖的虚假措辞(有依据但非真实的差距为 0.30–0.80),在两个领域的 5/5 次标准流程运行中均出现。针对该检验进行定向训练同样失败。最小化隐藏状态与其自身重构之间的距离,会移除此前可通过探针解码的内容。奖励言语化器的事实依据性,是通过重组指标所计数的句子结构来提升代理分数,而非通过提高逐条声明层面的事实依据性。r~=0.842%

能通过我们各项控制检验的干预措施,训练的是目标模型本身,而非激活读取器(图1b):即 RECAP,一种与模型共同训练、针对外部目标的线性头(§5)。全新的 NLA 随后在沙盒环境中,在共同训练和独立评估器下都能忠实地陈述指定内容,且代码签名特征消失。两种基于可解释性动机的替代方案均因已明确的原因而失败:以重建为目标的损失函数会压垮可解码内容,而冻结探针方法在表征漂移下会失效,无标签重新对齐可完全逆转这一失效。

Refer to caption
图1:两种架构。(a) 自然语言自编码器(先前工作)(Fraser-Taliente 等人,2026):AV 将激活映射为文本,AR 将其映射回去,重建质量即为检验标准;只有 AV 和 AR 参与训练。得分可以保持很高,而文本却断言了无依据的具体内容(红色“镜子”)。(b) RECAP(本文工作)训练目标模型。上图:共同训练的线性头使指定内容可针对外部目标解码。下图:训练后,一个独立的全新探针(非这些线性头)能恢复该内容(AUC 0.95),一个全新的言语化器能真实地陈述它。
  • 一项审计。对重建评分式解释进行反事实的、声明级别的审计,带有逐编辑有效性对照,表明一个已发布的言语化器能通过测试,尽管其具体声明在很大程度上缺乏依据;一个变换对照表明,是主旨而非具体措辞支撑了得分。

  • 一项发现。共同训练的言语化器/重建器对在精确真值沙盒环境中会发展出共同适应的私有编码;有依据与真实性的交叉检验以及评估器互换能够检测并量化这些私有编码。

  • 一项失败分析。自然训练修复方案会以已识别的机制失效:以重建为目标的损失函数会压垮可解码内容,而冻结探针在可恢复漂移下会失效。

  • 一种方法。RECAP 在沙盒环境中恢复了声明级别的忠实性(5/5 次运行),并迁移到 Pythia-160M,在目标设计规则下,指定内容可在可测量的代价下被探针解码,尽管对其的自由形式言语化仅部分实现(§5.4)。

  • 一项对抗性测试。一个报告空间中的对抗者针对部署后的重建分数进行优化,几乎能骗过该分数(压制了其谎言惩罚),在RECAP模型和对照模型上均是如此;然而RECAP的激活探针仍然能标记出谎言(AUC、召回率均达标),而对照探针则退化到随机水平。因此,RECAP的指定内容可解码性在报告空间博弈中依然存活;这一效果来自该可解码性本身,而非单纯读取激活值,并且重建分数本身绝不能用作真实性信号。87%0.950.860.51

2 预备知识与实验设置

2.1 重建测试与审计协议

自然语言自编码器(NLA)将激活值言语化器(AV)与激活值重建器(AR)配对使用:前者为隐藏激活值生成文本解释,后者将文本映射回估计值。AV在冷启动阶段之后,以重建奖励为目标进行训练;在目标模型权重冻结且使用其接入点激活值的条件下,该配对优化zhzh^θh

𝒥read=maxAV,ARcos(AR(AV(h)),h), (1)

所生成解释的重建质量即被视为其忠实性测试(图1a)。系统自身的报告对此有明确说明:它将重建分数的上升视为解释信息量的提升,同时警告目标函数中没有任何机制强制忠实性(Fraser-Taliente等人,2026)。但每条解释的分数正是这类系统所报告的数值,也是从业者应用的主要判据。我们要追问的是:该分数对每条解释中的具体论断究竟说明了什么。我们使用下限归一化的中心余弦来度量重建质量。设 为重建结果与不匹配激活值之间的平均余弦值(随机水平)。则 :随机水平时为0,完美重建时为1。我们发布系统的测量使用公开的Qwen-2.5-7B(Qwen团队,2025)第20层AV/AR配对;所有生成均为贪心解码。floorr~=(cos(h^,h)floor)/(1floor)

接地性。对于 中的某个论断 ,设 为仅对 做最小翻转后的版本(一种最小对反事实编辑,我们称之为翻转)。该论断的接地性定义为重建分数的下降量czz¬czc

Δr~(c)=r~(z)r~(z¬c), (2)

并且当……时是“有依据的”。这里的“依据”指的是重建对某个论断翻转的敏感性。本文的核心论点是:重建的敏感性与模型对同一翻转的计算敏感性并不相同,且两者在实践中会出现分歧。编辑有效性是逐条编辑进行检验的:那些改动超出目标论断范围的编辑,会把表面上的“依据”程度夸大数倍(见附录)。将“依据”与“真实性”交叉,可以得到一个二维分类:每个论断要么有依据、要么没有依据,同时要么与来源内容相符、要么不符。我们重点关注“有依据但不真实”这一类:即重建所依赖的措辞,其陈述内容却是虚假的。当这类措辞是共同训练对(co-trained pair)特有的约定时(通过评估器互换实验验证,见 §3.2),我们称之为“共同适应的私有代码”(co-adapted private code)。这些分类标签是操作性的,不隐含任何意图立场。结合共同训练重建器与独立重建器下的得分,该得分在评估器互换下的差距即为……。cΔr~(c)τr~cor~indr~cor~ind

术语说明。目标模型的激活值在某个激活位点(我们简称为“读取点”tap)被读取:即选定的某一层和某一位置。激活值可以由探针(probe,即新拟合的线性解码器)读取,也可以由重建器(AR)读取。Gist 指输入的总体含义,区别于其具体事实。当辅助预测器被共同训练以预测某项内容时,该内容即被“指定”(§5)。当新拟合的线性探针能够读取某项内容时,该内容即为“可解码的”。本文中的“忠实性”(faithfulness)始终是论断层面的:即解释的陈述内容是否对激活值为真,并且是否以该激活值为依据。我们不用“忠实性”来表示解释是否描述了模型的下游计算过程。(此处的“依据”指重建对论断翻转的敏感性,而非指涉现实世界的依据。)

实验设置。

我们在三种设置下进行评估:在分布内的网络文本上评估一个已发布的 Qwen-2.5-7B 第 20 层 NLA(审计声明);一个具有精确真实标签的沙盒环境,包含两个模板化合成领域,其中“抽头”位置决定了激活能承载什么(每个槽位要么保留、要么衰减、要么不可读),因此所有审计量都可以在没有评判器的情况下计算;以及对 Pythia-160M(Biderman 等人,2023)进行带自监督头的持续预训练,其中代价是留出的语言建模损失减去一个共享对照组。完整协议、领域语法、随机种子和超参数均见技术附录。n=1,517

3 审计重建评分解释

这两种失败具有不同的机制。在已发布的系统上,缺失的具体细节在很大程度上并未出现在“抽头”中,因此高分依赖于大意而非激活中的具体内容。在沙盒中,内容存在,但措辞是共同训练对之间私有的约定,通过评估器交换而暴露出来。只有沙盒失败是纯粹的指标伪影;已发布系统的失败反映了指标上游内容的缺失。

3.1 对已发布 Verbalizer 的反事实审计

在分布内的网络文本上,所发布系统的解释在有效最小对翻转下,其重构能力达到 ,而审计在其大语言模型显著的具体主张中约有 被检测为有依据( / / 在 / / 阈值下;逐位置表格见附录)。这一估计有两个限定条件。第一,这是一个受灵敏度限制的下界:基于重构的测量工具灵敏度较低,因此很可能低估了真实的依据程度。一种追加并排序的对照方法仅能以 的原始水平恢复一个已知编码的主题。第二,最稳健的统计量是主旨与具体细节之间的相对差距:具体细节的解码效果比主旨差约 (与经机会校正后的 相比,逐位置;均值池化的主旨达到 ,见附录)。我们审计了基础系统的主张(两个训练变体中分别为 1,428–1,471 条)。逐阈值的自助法置信区间和经验性翻转噪声零分布见附录;该零分布位于最小阈值之下。这些结果表明,尽管系统对大多数被审计的具体主张依赖较弱,但仍实现了较高的重构能力。一种变换轮廓对照(释义和内容掩蔽消融)直接证实了这一点:重构在释义后仍然存活,但在内容词被掩蔽时崩溃(见附录),因此承载得分的是主旨而非具体措辞。这一差距在 16–27 层中持续存在,并且是重构式读出所特有的:模型自身的解嵌入确实能看到这些深层具体信息,以下一 token 的形式呈现(见附录)。r~=0.842%4.2%2.1%1.6%τ=0.020.050.10τ2%28%3×6%18%50%n=1,517

也可以直接针对依据性来训练语言表达头。我们尝试了两种方法:拒绝采样和针对子句级依据奖励的 GRPO。两者都改善了各自的代理指标,而独立的子句级审计在每个 阈值下都保持无效(置信区间跨越零)。文本统计将收益归因于句子重构——合并和打包策略所控制的单元——而非子句级依据性的提升。这促使我们转向一个所有量都精确可测的环境:沙盒。τ

3.2 合成真实依据下的审计

通过该测试的第二种方式出现在精确合成真值条件下。在每一次沙盒运行中,玩具 NLA 都会自信地断言每个槽位,同时以 0.71–0.86 的得分通过测试(两个领域各 5/5 次运行;代表性示例见附录)。真值对可解码性的追踪较为松散:完全可解码的槽位在不同随机种子下以 0.44–0.96 的比率被真实陈述(但在所有情况下 grounded 得分均为 0.76–0.88),部分可解码的槽位为 0.15–0.26,而不可读槽位则处于随机水平。该测试无法区分真实陈述与虚假陈述,因为训练信号中不包含此类要求。r~

除了真值比率之外,联合训练对还产生了第二种系统性现象。在两个领域的 5/5 次标准流程运行中,它都发展出了共同适应的私有编码:重建过程所依赖的措辞选择,即使这些措辞是虚假的,其 grounded 与 true 之间的差距为 0.30–0.80。grounded 与 true 的交叉比对就是检测器:一个编码既是 grounded 的又是虚假的。编码可以同时占据多个槽位。在领域 2 中,一个编码占据了一个不可读槽位:重建器所依赖的任何措辞都足以满足要求,无论其内容是否真实甚至是否可能成立。在这种情况下,这对模型并不是在描述激活状态,而是将句子用作通信渠道。

评估器替换提供了证据,表明该通道是共同训练对特有的约定。在独立评估器(训练时未接触被审计对的输出)下,代码槽位的接地率从 0.53–0.89 骤降至 0.08–0.23,而真实主张的接地率则得以保留。该替换将每个主张定位在“按真实性接地”表中。跨评分者差距(标准运行下为 0.17–0.38,而 RECAP 运行下则不同,见 §5)即为及格分数的评估器差距。由于真实主张的接地率在替换后仍然存在,这一差距可归因于共同适应而非评估器质量。独立性在措辞层面同样成立:一个在不相交的释义族(不同的框架和槽位顺序,仅共享槽位词)上训练的独立评估器,在三个随机种子中复现了相同的模式:代码槽位接地率保持坍塌,而真实接地率得以保留(RECAP 槽位为 1.00)。因此,该通道是共同训练对私有的,而非模板共享的约定。r~0.0030.05

最后,标准配方的言语化器即使对已存在的内容也存在读取不足:在领域 2 中,从目标模型中可解码 55–72% 的槽位,其真实陈述率仅为 15–26%,这构成了读取差距(内容存在但未被言语化器传达),与存储差距(内容在激活中缺失)并存,而下面的干预措施也能弥合这一差距。

4 表征坍塌与探针漂移

最自然的目标侧目标函数是让激活值朝向其自身的重建结果移动,从而使探针恢复的内容与模型计算的内容保持一致。该目标函数会消除可解码内容:在所有测试强度下,无论初始化方式如何,在 3/3 个随机种子中,它都能移除可解码的槽位内容,同时困惑度保持不变。重新训练的探针准确率同样下降,因此信息本身已消失,而不仅仅是旋转到了探针无法读取的子空间中。该机制与非对比式自监督坍缩的解释一致(Chen 和 He 2021;Tian 等人 2021)。重建是对状态的有损投影,因此提高状态-重建相似度会减少探针子空间之外的变异,并移除探针无法恢复的任何内容。

第二种失效模式是持续训练过程中的表征漂移。与训练模型匹配的探针在 1,500 步持续训练后衰减至接近随机水平(3/3 个随机种子),并且跨种子均处于随机水平(6/6 对);然而信息本身仍然完好无损且可精确恢复。在成对激活值上拟合的线性映射(无需标签)在 9/9 种情况下恢复了探针原有的性能。对该映射进行分解(见附录中的模式扫描图)表明,仅旋转就能恢复约一半的漂移;完全恢复需要秩为 16–64 的非正交变换。Duan(2026)同时在 2B 和 7B 参数模型上报告了相同的陈旧性与修复现象。

漂移与修复的发现具有部署层面的影响:对仍在训练中的模型进行基于探针的监控,必须包含明确的重新校准流程。重新对齐可以恢复探针访问目标模型所存储内容的能力,但模型存储的内容是否正确才是根本问题。重新对齐调整的是坐标;RECAP 改变的是这些坐标所代表的内容。由此得出一个推论:由于表征之间相差一个仿射映射,基于适配器的跨模型探针迁移应当可行(Zhao 等人 2026)。

5 RECAP 目标函数

媒体内容 · 前往原文查看
配置 度量(nats) 探针 AUC
对照组(基线) 不适用 0.77–0.80
K=8,朴素,w=1.0 +0.047 1.000
K=64,朴素,w=1.0 +0.064 0.95–0.97
K=64,均衡,w=0.1 +0.010 0.97–0.99
K=512,均衡,w=1.0 +0.140.20 0.97–0.99
表 1:RECAP 规模化实验结果:指定目标上的留出法税负(LM 损失减去对照,nats)和新探针 AUC。平衡税负为 3 个种子的配对差值(95% 置信区间);另一平衡行是 3 个种子的范围,其余为单种子结果。K=64[0.015,+0.034]

5.1 方法

RECAP(通过协同训练的辅助预测器实现可读编码)在目标模型训练期间向其添加线性辅助预测器(头),使得指定内容能够从选定的隐藏状态中解码。每个头读取抽头层的隐藏状态并预测外部目标:沙盒中的槽位值、规模化下的自监督文本函数。然后将头损失添加到语言建模损失中。给定头参数和外部目标,ϕy

𝒥model=minθ,ϕLM(θ)+wϕ(h(θ),y), (3)

其中 是存在性的类平衡 BCE 加上身份识别的 CE(平衡可防止 §5.3 中的平凡捷径)。将式 3 与式 1 进行比较,阐明了本文的核心论点: 针对冻结模型的激活优化了言语器和重构器,且从不触及 ,而 则对自身进行训练,为言语器和重构器将需要的真实标签向语言建模损失中添加一项。每个先前的失败模式都从结构上得到解决,而非打补丁。漂移:头与目标模型协同训练,因此不存在会过时的冻结探针。坍缩:目标是外部真实标签,而非模型自身的重构,因此不存在会坍缩的自我参照目标。编码:头直接从激活中预测,没有中间文本表示。由于协同训练的预测器可能与模型共同适应,我们报告的每个可解码性数字都来自独立拟合的新探针,而非来自头。RECAP 是深度监督谱系中的可解码性监督(Lee 等人,2015;Szegedy 等人,2015)。我们的贡献在于识别了以可解释性为动机的替代方案失败的原因,并证明了目标模型的可解码性会传播到言语器的真实性中。ϕ𝒥readθ𝒥modelθ

5.2 沙盒结果

在目标模型上,RECAP 产生了预期效果。指定内容通过独立拟合的探针达到了 100% 的可解码率,以 nats 为单位,在 5/5 次运行中均如此(域 1 中的元组不相交划分,域 2 中的保留划分)。不可读目标在每次运行中都保持随机水平,证实了不可控性约束:注意力头无法编码因果结构所排除的内容。我们在下面预训练的 Pythia-160M 上重新估计了这一能力代价,其值为 nats(在 0.06-nat 的种子散布范围内),并且取决于目标设计;我们没有将模型规模扩展到 160M 以上。+0.001+0.010

传播特性是将其与训练技巧区分开来的关键。在 RECAP 目标模型上训练的全新 NLA 在共同训练和独立评估器下都能以真实性和基础性陈述指定内容,并在基础性层面标记剩余的虚假内容。任何 RECAP 运行中都没有出现代码签名:跨独立种子的 5/5 次全指定运行和单种子上的 0/3 次部分指定变体均为零(见附录中的涌现台账)。两个 NLA 接受完全相同的训练,包括对黄金描述进行冷启动 SFT;只有基于 RECAP 目标模型激活训练的 NLA 保持了近乎完美的真实性和基础性,因此这一差异隔离了目标模型可解码性的影响。1.000

剂量实验修正了我们最初的解释。我们曾预测在部分指定下代码会迁移到未指定的槽位中;相反,任何剂量都完全阻止了代码的出现(单一域和种子)。我们没有分离出具体机制;一种可能性是,任何外部真实性通道都会使基于基础性的解具有更低的损失,因此梯度永远不会偏向代码。部分指定确实抑制了沙盒中未指定内容的可解码性(从 0.21–0.27 降至 0.10–0.15),但这在更大规模上未能复现。

Refer to caption
图 2:从真实模型隐藏状态中解码内容(一段保留的 Pile(Gao 等人,2020)文本;新探针读取标记位置的第 6 层状态)。在 RECAP 训练的模型上,探针恢复了尾部窗口内容词和偏移 8 的 token;在对照模型上,读出结果是混乱的。探针配方和数据完全相同;只有目标模型不同。

5.3 扩展到 Pythia-160M

我们接下来测试 RECAP 是否能迁移到 Pythia-160M 的持续预训练中。(设置:§2.1;表 1;图 2 展示了一次读出结果。)有三项结果。监督信号可迁移:在 和 下,指定内容在新探针上的 AUC 达到 0.95–1.00,而对照组基线为 0.77–0.80。独立审计在大规模场景下至关重要:在 下,朴素的“存在性”头在最小化其训练损失的同时,却让新探针无法解码出任何内容(见附录)。稀有目标会让某个头通过总是预测“不存在”而获得高分,这种捷径只有独立探针才能暴露出来。按类别频率平衡损失可在两种剂量下堵住该捷径(全部 512 个目标上达到 0.97–0.99)。设计规则是:所选目标的损失无法在不进行真正区分的情况下被最小化。可解码性代价取决于目标设计。在有效设计下,64 个目标的代价为 nats(配对 95% CI ,各 3 个种子),处于 0.06 nat 的种子波动范围内,与零无法区分。当目标数增至 512 时,代价升至 – nats。一个具有判别性的身份目标在 (全权重的三十三分之一)下仍保持可解码,且代价在噪声范围内趋近于零。在所有八次有监督运行中,从未被指定的探针桶始终处于对照组水平。K=8K=64K=512+0.010[0.015,+0.034]d=768+0.140.20w=0.03

可解码性对头容量和探针层选择也具有鲁棒性:非线性(MLP)头在第 6 层达到相同的 0.98–0.99 指定探针 AUC,而线性头在第 9 层将 AUC 从 0.77–0.79(对照组)提升至 0.95–0.98,代价为 nats。全权重扫描以及程序中变化的其他因素(拉取强度、指定剂量、重对齐映射类别、评估器、领域、头容量、探针层)均已在技术附录中与结果对应列出。+0.01

5.4 大规模 Verbalizer 审计

传播(Propagation)首次获得了真实模型层面的证据。我们使用所发布配方(recipe)的结构,在这些“水龙头”(taps)上训练了一组 AV/AR 配对模型,并对照精确的自监督真值(self-supervised truth)对其进行了审计。结果表明,在 RECAP 模型上,上下文词汇的真实性(truth)得分为 0.44,而对照组仅为 0.06(基于 tap 聚类的 bootstrap 95% 置信区间分别为 0.39–0.51 与 0.04–0.09)。对照组在大规模上复现了“有根基但虚假”(grounded-and-false)的特征:所陈述词汇的根基性(grounded)得分为 0.48,但真实性仅为 0.06。RECAP 将这一“根基性减真实性”的差距从 0.42 缩小至 0.04,但并未完全消除:在大规模上,内容陈述得更真实,但并非完全无代码(code-free)。真实性提升并非仅仅是选择性效应:在共享的现存内容词汇集合上(400 个 tap 中共 381 个),RECAP 也恢复了更多此类词汇(召回率 0.29 对比 0.07),同时每条解释陈述的词汇更少(0.63 对比 1.02)。这一差距对重建器(reconstructor)的强度具有鲁棒性:更高信号的重建器(0.30)使 RECAP 在真实性(0.57 对比 0.15)和召回率(0.47 对比 0.04)上均保持领先。对照组陈述的词汇更少(92 对比 312),但在两项指标上仍落后。在 RECAP 目标模型的三个不同随机种子下,每个种子都配有全新的 NLA(三个 NLA 用于 RECAP 模型,三个用于对照组),所陈述词汇的真实性保持稳定(0.44–0.46,而对照组为 0.00–0.07)。+0.42+0.33r~

然而,verbalizer 仅传达了激活中所含信息的一部分,而这种不足是生成过程的属性,而非存储的属性。在 verbalizer 自身的召回层面上,对同一 tap 使用新的探针可达到的精确度,与 verbalizer 自身在各类 reconstructor 和随机种子下 0.44–0.63 的精确度形成对比(精确度-召回率图见附录)。我们将这一不足定位到生成过程本身。我们重新设计了 reconstructor:标准化多 token 注入、MLP 容量,以及一个基于精确窗口出现真值(外部标签,而非学习得到的监控器)训练的 decode-point presence head。它使得指定内容能够从其自身的 decode-point 隐藏状态以 0.79–0.81 的精确度(两个随机种子)线性解码。然而,同一 reconstructor 的生成精确度仍保持在 0.56–0.63。在相同 head 下,匹配的对照组的 decode-point 状态读取结果仅为随机水平(0.03),因此可解码的内容来自 RECAP,而非该 head。无论是 reconstructor 规模、重建优化、直接真值奖励、注入带宽,还是显式负监督,都无法弥合这一差距(3B reconstructor 与 0.5B 的表现相当)。在规模层面,RECAP 的保证是可解码性:指定内容存在且可通过探针验证。重建族 verbalizer 仅将其部分转化为文本。因此,自由形式的解释是激活所包含内容的损失性呈现,而我们基于探针的监控器是针对内部状态来验证声明,而非信任文本本身。(offset-8 目标不会传播,但其真实 token 仅在 2.2% 的 tap 中作为指定槽位出现,数量过少难以刻画;我们将其报告为未恢复,而非代码。)0.80

可解码性是一项持续成本,而非一次性设置:在无 head 微调后的几百步内它就会衰减,必须持续维护(nats),或以约十分之一的计算量间歇性维护,因此最好从一开始就训练进去,而不是事后恢复(见附录)。+0.010

6 基于探针的监控

我们通过审计员现在能够验证的内容来衡量 RECAP 的价值。我们在沙盒中构建了最简单的监督工具:每个槽位的新探针读取开关激活状态,语言表达器(verbalizer)声明槽位值,任何与高置信度探针()相矛盾的声明都会被标记为疑似差异。随后,精确的基准真值对检测器进行评分(完整协议和各阶段计数见附录)。p>0.9

在标准目标模型上,检测器是可靠的,但召回率较低。每个标记都是真实的虚假声明(零误报),但大多数开关前声明所在的槽位可解码性过低,无法获得高置信度的读取结果,因此只能捕获 733 条中的 27 条。在 RECAP 目标模型上,结果发生了逆转:不再存在开关前的虚假声明,弃权率降至零,因此每条声明都通过与内部状态比对来验证,而非凭信任接受。指定开关前内容的验证覆盖率从 37% 提升到 100%;这一增益体现在指定内容的覆盖率上,而非检测器的精确率,且该覆盖率并不扩展到整个激活状态。开关后的声明在两个目标模型上都被正确地弃权处理,因为激活状态中明确缺失的内容无法通过读取激活状态来裁决。捕获这些内容正是接地交叉(grounding cross)的职责;这两个工具分工完成审计(一个领域、一个种子、一个阈值;完整协议见附录)。

该监控器可扩展到真实模型。在 Pythia-160M 上,一个新的存在性探针在 AUC 上将真实声明排在虚假声明之前,对照组的 AUC 为 与 ( 置信区间 和 ,672 条保留声明;区间不重叠)。它还能以 的召回率和 的精确率标记虚假声明,标记阈值在独立的校准划分上设定。因此,RECAP 不仅改善了探针读取的内容,还提升了其监控语言表达器的能力。在规模化后的基础比率下,沙盒中每条声明的置信覆盖率指标不再适用,因此我们改为报告检测器 AUC 和标记的精确率–召回率点。语言表达器提出声明,探针负责验证:在规模化场景下,探针而非自由形式的解释才是可靠的读取方式,这与训练模型使其内容可被核查而非信任其文字表述的思路一致。0.9650.82395%[0.956,0.973][0.759,0.879]0.93[0.90,0.96]0.871.5%

该监控器能够抵御对手对分数的攻击。

一个信任重建分数的部署方案将暴露于报告空间(report-space)攻击者之下:在诚实解释中,将一个真实陈述的词编辑为一个不存在的词,并选择能使重算分数最大化的编辑方式(完整协议与各层级详见技术附录)。在分数最优编辑下,两个模型上的谎言惩罚几乎消失:对于陈述的真实词,最优谎言仅降低(置信区间),而随机谎言则降低,抑制率达 87%。然而,外部真实激活探针(probe)仍能在 RECAP 模型上以 AUC(召回率)识别出谎言,而在对照模型上则降至随机水平(AUC,召回率)。因此,这种存活性是 RECAP 可解码内容所特有的。对照探针同样能读取报告空间攻击者无法触及的激活,却以失败告终:读取先于可编辑报告存在的信号是必要条件,但并非充分条件;内容还必须可解码,而这正是 RECAP 所提供的。选择泄漏可见但较小(随着分数最优的缺失词在语义上更接近,RECAP 探针沿攻击者层级从 AUC 漂移至),因此,在报告空间威胁模型(而非激活级攻击,Bailey 等人,2024)内,对分数操纵的免疫是结构性的,对候选选择的免疫则是经验性的。即使是感知探针的选择攻击者(假设监控器泄漏,超出我们的威胁模型),也仅将 RECAP 监控器降至 AUC,同时将对照模型推至随机水平以下(白盒选择攻击的预期特征)。这种分离随攻击者强度增强而扩大。因此,部署的分数不能用作针对此类攻击者的真实信号;而基于 RECAP 可解码内容的探针则可以。这一精度工作点并非在评估集上调整:在不相交的划分上重新校准标记阈值,召回率基本不变(冻结与评估调优相比),且即使面对随机谎言,也没有任何对照探针阈值能达到精度。该效应也仅限于指定内容:在模型从未被训练保持可解码的保留词汇带(排名 64–128 的词)上,RECAP 监控器相比对照无优势(诚实情形 AUC 对比,整个阶梯上的臂差距在以内,检验效能足以检测以上的差距)。因此,指定既是该效应的机制,也是其作用范围(完整协议与词汇带表格见附录)。r~0.02295%[0.017,0.027]0.1730.9520.860.5080.010.9930.9520.9090.2420.90.880.860.90.660.70±0.060.07

7 相关工作

激活值言语化及其批评。

在NLA方法(§2)(Fraser-Taliente等人,2026)之外,一个快速发展的家族改进了读取器:有监督的问答解码器(Pan等人,2026)、通用激活值解释器(Karvonen等人,2025;Bauer等人,2026)、解释器助手(Huang等人,2025)、免训练读取器(Ghandeharioun等人,2024)以及跨模型适配器(Zhao等人,2026)。稀疏自编码器是无监督读取器家族(Huben等人,2024);陈旧性问题适用于任何冻结的读取器。模型生成的解释在思维链中通过了合理性检查,但缺乏忠实性(Turpin等人,2023;Lanham等人,2023);对神经元解释的因果测试发现了高错误率和低有效性(Huang等人,2023);反事实忠实性测试预示了我们的翻转协议(Atanasova等人,2023)。现有的言语化批评停留在基准层面:许多任务无需目标模型的内部信息即可解决(Li等人,2025)。我们在两个维度上有所不同:我们审计测试本身(逐条主张、反事实地、在已发布的系统上进行),并且我们的修复训练的是目标模型,而非更好的读取器。

学习通道中的隐写术。

自 CycleGAN(Chu 等人,2017)以来,重建族目标函数一直在其通道中隐藏信息。在大语言模型中,编码推理在优化压力下出现于思维链中(Roger 和 Greenblatt,2023),并在过程监督下泛化(Skaf 等人,2025)。错误设定的激励会产生隐写式串通(Mathew 等人,2025),工具使用拓宽了通道(Rippin 等人,2026),而探测内部状态可检测串通(Rose 等人,2026)。优化可以混淆激活以对抗潜在监控器(Bailey 等人,2024),而针对思维链监控器进行训练会产生混淆式奖励黑客行为而非诚实(Baker 等人,2025)。所有这些通道都是被诱导出来的:由激励、过程监督或对抗方诱导。我们的编码仅从标准重建配方中涌现,出现在可解释性流水线内部,不涉及隐写目标或通信奖励。在那些工作建议不要在监控器上进行优化的地方,我们展示了一条互补路径:针对外部真实值监督目标模型,使其内容可解码,而无需迫使它欺骗探针或重建器。

表征漂移、拼接与监控器陈旧性。

网络学习到的表征在变换意义上是等价的(Lenc 和 Vedaldi,2015;Kornblith 等人,2019;Moschella 等人,2023);仿射映射可在语言模型间迁移特征(Chen 等人,2025);预训练动态在不同随机种子间是稳定的(van der Wal 等人,2025);调谐透镜正是我们刻画其陈旧性的仿射读取器(Belrose 等人,2023)。与此同时,Duan(2026)在 2B 和 7B 参数模型上报告了相同的陈旧性和无标签修复,这是部署规模上的趋同证据;在针对探针感知微调之后,重新训练探针也能恢复可检测性(Wehner 和 Fritz,2025)。我们的新增贡献:恢复解剖(第 4 节)、跨种子失败、信息比其读取器存活更久的精确证据,以及漂移与崩溃的区分。

深度监督与内在可解释性。

在隐藏层上添加辅助头属于深度监督(Lee 等人,2015;Szegedy 等人,2015);那里的目标是任务标签;我们的目标是保持可解码性的外部内容。概念瓶颈将所有信息流经由命名概念路由(Koh 等人,2020;Sun 等人,2025),概念白化约束表征的几何结构(Chen 等人,2020),码本特征将表征离散化(Tamkin 等人,2023),梯度路由将计算局部化(Cloud 等人,2024);我们则在不约束信息流的前提下添加线性头。解释侧监督可以追踪行为变化(Guo 等人,2026);我们的监督位于目标模型侧。

8 讨论与局限性

适用范围与局限性。我们的证据来自一个合成沙盒、一个已发布的 NLA(Qwen-2.5-7B),以及对一个小模型(Pythia-160M)的继续预训练,且大多在单一随机种子下进行;前沿规模尚未得到验证。四个局限性制约了我们的结论。第一,我们的沙盒和规模审计仅覆盖封闭词表、模板解析的陈述,监控器也只覆盖指定内容;开放式忠实度尚未被度量。第二,RECAP 必须协同训练,无法事后加装到冻结模型上,并且它依赖于选择合适的目标:选择不当的目标可能在未解码出任何内容的情况下报告成功。第三,可解码性不等于可言语化:内容可以通过探针解码,但自由形式的言语化器只能传达其中一部分,因此探针是更可靠的读取方式。第四,RECAP 认证的是激活中存储了什么,而非模型使用了什么:指定内容可以存在且可核查,却在行为上毫无影响(对监测点进行扰动几乎不改变行为),而且模型可能绕开被监控的子空间进行计算路由(Mahinpei 等人,2021;Margeloiu 等人,2021)。0.003

对经重建测试的言语化而言,成功意味着:解释的具体主张能对照目标模型得到验证,在内容缺失时能进行校准式弃权,以及配备重新校准协议的监控器——而非更高的分数。r~

9 结论

我们对自然语言激活解释背后的重建测试进行了审计。该测试可以通过要点(gist)和私有代码(private codes)通过,而针对该测试的训练会导致模型崩溃或代理博弈(proxy gaming),而非忠实性。在我们的控制条件下能够存活的修复方案是 RECAP:训练目标模型,而不是读取器(reader)。它在沙盒环境中产生了忠实于主张的言语化器(verbalizer)(5/5 次运行),并使指定内容在 Pythia-160M 上可被探针解码,其中一个新的言语化器以 0.44–0.46 的分数真实地陈述了该内容(三个目标模型种子;使用更强的重建器时最高可达 0.57),而对照组接近零。在沙盒环境中,基于探针的审计器对指定内容的覆盖率从 37% 上升到 100%;在更大规模上,探针将言语化器的真实主张排在虚假主张之上,AUC 为 0.965 对比 0.823(95% 置信区间不重叠),即读取内容的可靠性高于言语化器生成内容的可靠性。总体教训是方法论层面的:对模型自身解释的学习式测试可能被该模型本身所博弈。因此,将可解码性训练进目标模型,比事后审计已训练好的模型更为可靠。

参考文献

  • P. Atanasova, O. Camburu, C. Lioma, T. Lukasiewicz, J. G. Simonsen, and I. Augenstein (2023) 自然语言解释的忠实性测试。发表于 ACL,注:arXiv:2305.18029。被引用:§7。
  • L. Bailey, A. Serrano, A. Sheshadri, M. Seleznyov, 等 (2024) 混淆激活可绕过 LLM 潜空间防御。arXiv 预印本 arXiv:2412.09565。被引用:§6, §7。
  • B. Baker, J. Huizinga, L. Gao, Z. Dou, M. Y. Guan, A. Madry, W. Zaremba, J. Pachocki, and D. Farhi (2025) 监控推理模型的不当行为及促进混淆的风险。arXiv 预印本 arXiv:2503.11926。被引用:§7。
  • J. Bauer, C. De Schamphelaere, A. Karvonen, N. Luick, and N. Nanda (2026) 构建更好的激活预言机。arXiv 预印本 arXiv:2606.02609。被引用:§7。
  • N. Belrose, I. Ostrovsky, L. McKinney, Z. Furman, L. Smith, D. Halawi, S. Biderman, and J. Steinhardt (2023) 使用调谐透镜(tuned lens)从 Transformer 中引出潜在预测。arXiv 预印本 arXiv:2303.08112。被引用:§7。
  • S. Biderman、H. Schoelkopf 等人(2023)《Pythia:用于分析大语言模型训练与扩展过程的套件》。发表于 International Conference on Machine Learning,引用位置:§2.1。
  • A. Chen、J. Merullo、A. Stolfo 和 E. Pavlick(2025)《通过模型拼接跨语言模型迁移线性特征》。arXiv 预印本 arXiv:2506.06609。引用位置:§7。
  • X. Chen 和 K. He(2021)《探索简单的孪生表示学习》。发表于 CVPR,引用位置:§4。
  • Z. Chen、Y. Bei 和 C. Rudin(2020)《用于可解释图像识别的概念白化》。Nature Machine Intelligence 2,第 772–782 页。引用位置:§7。
  • C. Chu、A. Zhmoginov 和 M. Sandler(2017)《CycleGAN,隐写术大师》。发表于 NIPS Workshop on Machine Deception,备注:arXiv:1712.02950。引用位置:§7。
  • A. Cloud、J. Goldman-Wetzler、E. Wybitul、J. Miller 和 A. M. Turner(2024)《梯度路由:通过掩蔽梯度来定位神经网络中的计算》。arXiv 预印本 arXiv:2410.04332。引用位置:§7。
  • E. Duan(2026)《激活监控器能否在模型更新后继续存活?对激活监控器过时问题的基准测试、预测与修复》。arXiv 预印本 arXiv:2606.15980。引用位置:§4、§7。
  • K. Fraser-Taliente、S. Kantamneni、E. Ong、D. Mossing、C. Lu 等人(2026)《自然语言自编码器为大语言模型激活提供无监督解释》。备注:Transformer Circuits Thread,transformer-circuits.pub/2026/nla。引用位置:图 1、§1、§2.1、§7。
  • L. Gao、S. Biderman、S. Black 等人(2020)《The Pile:一个 800GB 的多样化文本语言建模数据集》。arXiv 预印本 arXiv:2101.00027。引用位置:图 2。
  • A. Ghandeharioun、A. Caciularu、A. Pearce、L. Dixon 和 M. Geva(2024)《Patchscopes:一个用于检视语言模型隐藏表示的统一框架》。发表于 ICML,引用位置:§7。
  • Z. C. Guo、L. Ruis、J. Andreas 和 B. Z. Li(2026)《内省耦合:在固定监督下,自我解释训练追踪行为变化》。arXiv 预印本 arXiv:2606.32038。引用位置:§7。
  • J. Huang、A. Geiger、K. D’Oosterlinck、Z. Wu 和 C. Potts(2023)《严格评估神经元的自然语言解释》。发表于 Proceedings of the 6th BlackboxNLP Workshop,第 317–331 页。备注:arXiv:2309.10312。引用位置:§7。
  • V. Huang、D. Choi、D. D. Johnson、S. Schwettmann 和 J. Steinhardt(2025)《预测性概念解码器:训练可扩展的端到端可解释性助手》。arXiv 预印本 arXiv:2512.15712。引用自:§1、§7。
  • R. Huben、H. Cunningham、L. Riggs Smith、A. Ewart 和 L. Sharkey(2024)《稀疏自编码器在语言模型中发现高度可解释的特征》。发表于 ICLR,注:arXiv:2309.08600。引用自:§7。
  • A. Karvonen、J. Chua、C. Dumas、K. Fraser-Taliente、S. Kantamneni 等人(2025)《激活预言机:训练和评估 LLM 作为通用激活解释器》。arXiv 预印本 arXiv:2512.15674。引用自:§1、§7。
  • P. W. Koh、T. Nguyen、Y. S. Tang、S. Mussmann、E. Pierson、B. Kim 和 P. Liang(2020)《概念瓶颈模型》。发表于 ICML。引用自:§7。
  • S. Kornblith、M. Norouzi、H. Lee 和 G. Hinton(2019)《重新审视神经网络表征的相似性》。发表于 ICML。引用自:§7。
  • T. Lanham、A. Chen、A. Radhakrishnan、B. Steiner 等人(2023)《衡量链式推理中的忠实度》。arXiv 预印本 arXiv:2307.13702。引用自:§7。
  • C. Lee、S. Xie、P. Gallagher、Z. Zhang 和 Z. Tu(2015)《深度监督网络》。发表于 AISTATS。引用自:§5.1、§7。
  • K. Lenc 和 A. Vedaldi(2015)《通过测量等变性和等价性来理解图像表征》。发表于 CVPR。引用自:§7。
  • M. Li、A. M. Ceballos Arroyo、G. Rogers、N. Saphra 和 B. C. Wallace(2025)《激活言语化方法是否传达了特权信息?》。arXiv 预印本 arXiv:2509.13316。引用自:§7。
  • A. Mahinpei、J. Clark、I. Lage、F. Doshi-Velez 和 W. Pan(2021)《黑盒概念学习模型的承诺与陷阱》。arXiv 预印本 arXiv:2106.13314。引用自:§8。
  • A. Margeloiu、M. Ashman、U. Bhatt、Y. Chen、M. Jamnik 和 A. Weller(2021)《概念瓶颈模型是否按预期方式学习?》。arXiv 预印本 arXiv:2105.04289。引用自:§8。
  • Y. Mathew、O. Matthews、R. McCarthy、J. Velja、C. Schroeder de Witt、D. Cope 和 N. Schoots(2025)《隐于明文之中:LLM 中隐写共谋的出现与缓解》。发表于 IJCNLP-AACL,注:arXiv:2410.03768。引用自:§7。
  • L. Moschella、V. Maiorca、M. Fumero、A. Norelli、F. Locatello 和 E. Rodolà(2023)《相对表示实现零样本潜在空间通信》。发表于 ICLR,备注:arXiv:2209.15430,被 §7 引用。
  • A. Pan、L. Chen 和 J. Steinhardt(2026)《LatentQA:教会大语言模型将激活值解码为自然语言》。发表于 ICLR,备注:arXiv:2412.08686,被 §1、§7 引用。
  • G. Penedo 等人(2024)《FineWeb 数据集:从网络中提取大规模高质量文本数据》。arXiv 预印本 arXiv:2406.17557,被附录 C 引用。
  • Qwen 团队(2025)《Qwen2.5 技术报告》。备注:arXiv 预印本 arXiv:2412.15115,被 §2.1 引用。
  • J. L. Rippin、S. C. Marshall、D. D. Africa 和 C. Schroeder de Witt(2026)《工具使用使多智能体大语言模型系统能够实现不可检测的隐写术》。arXiv 预印本 arXiv:2606.28425,被 §7 引用。
  • F. Roger 和 R. Greenblatt(2023)《防止语言模型隐藏其推理过程》。arXiv 预印本 arXiv:2310.18512,被 §7 引用。
  • A. Rose、C. Cullen、S. Abdelnabi、P. Torr、B. G. Kaplowitz 和 C. Schroeder de Witt(2026)《通过多智能体可解释性检测多智能体合谋》。arXiv 预印本 arXiv:2604.01151,被 §7 引用。
  • J. Skaf 等人(2025)《大语言模型能够在过程监督下学习并泛化隐写式链式推理》。arXiv 预印本 arXiv:2506.01926,被 §7 引用。
  • C. Sun、T. Oikarinen、B. Ustun 和 T. Weng(2025)《概念瓶颈大语言模型》。发表于 ICLR,备注:arXiv:2412.07992,被 §7 引用。
  • C. Szegedy、W. Liu、Y. Jia、P. Sermanet 等人(2015)《用卷积更深入》。发表于 CVPR,被 §5.1、§7 引用。
  • A. Tamkin、M. Taufeeque 和 N. D. Goodman(2023)《码本特征:神经网络的稀疏离散可解释性》。arXiv 预印本 arXiv:2310.17230,被 §7 引用。
  • Y. Tian、X. Chen 和 S. Ganguli(2021)《理解无对比对的自监督学习动态》。发表于 ICML,被 §4 引用。
  • M. Turpin、J. Michael、E. Perez 和 S. R. Bowman(2023)《语言模型并不总是说出真实想法:链式推理提示中的不忠实解释》。发表于 NeurIPS,备注:arXiv:2305.04388,被 §7 引用。
  • O. van der Wal、P. Lesci、M. Müller-Eberstein、N. Saphra、H. Schoelkopf、W. Zuidema 和 S. Biderman(2025)《PolyPythias:五十次语言模型预训练运行中的稳定性与离群值》。arXiv 预印本 arXiv:2503.09543。引用自:§7。
  • J. Wehner 和 M. Fritz(2025)《基于探针的微调以降低有害性》。arXiv 预印本 arXiv:2510.21531。引用自:§7。
  • H. Zhao、Z. He、G. Wang、A. Payani、Y. Li 和 M. Du(2026)《通用激活言语化器:跨模型激活解释的统一框架》。arXiv 预印本 arXiv:2605.25903。引用自:§4、§7。

附录 A 最小对立对翻转的编辑有效性

接地测量的质量取决于产生这些测量的编辑的质量。一个编辑是有效的,当且仅当它恰好翻转一个主张且不改变其他任何内容。我们在已发布的系统上审计了两个编辑生成器:一个闭源模型评判器产生有效编辑的比例为 68.4%,而本文全程使用的开源评判器(Gemma-4-12B,固定修订版本,温度 0)产生有效编辑的比例为 99.3%。无效编辑的主要问题是过度改写:它们连同目标主张一起重写了周围材料,额外的改动将表观接地程度放大了约七倍。因此,论文中所有接地比例均使用开源评判器并经过逐编辑有效性过滤;正文用一句话报告了这一情况,审计产物保留了逐主张的重构差异。同一组对比测试还测量了一种无评判器的掩码重打分信号与翻转工具的一致性(在经验证的评判器下 AUC 为 0.997),该信号用于附录 G。

附录 B 安全实验 1:差异检测器

问题。

如果审计者能够通过探针读取目标模型的激活,并且也能读取言语化器的输出,那么两者之间的不一致就可能是潜在的谎言。这个检测器有多大用处?其有用性又取决于什么?

实验方案。

沙盒环境,域 1,种子 1,每个目标模型 400 个保留的 tap。对于每种槽位类型,我们在 tap 的探针划分上拟合一个全新的多项逻辑回归探针(线性,256 维输入),从 tap 激活中读取槽位值。在评估 tap 上,言语化器生成解释;每个槽位类型的第一个陈述词与探针的预测进行比较。当置信度高于 0.9 的探针与陈述词不一致时,该声明被标记为可疑;当探针置信度低于阈值时,则弃权。精确的元组真值随后对每个决策进行评分。

媒体内容 · 前往原文查看
模型 阶段 声明数 虚假数 标记数 精确率 弃权率
对照组 tap 前 1200 733 27 1.000 0.632
对照组 tap 后 800 698 0 1.000
RECAP tap 前 1200 0 0 0.000
RECAP tap 后 800 706 0 1.000
表 2:差异检测器,每个目标模型 2,000 条声明。精确率是标记中真正虚假声明的比例;召回率是被标记的虚假声明的比例;弃权率是探针在阈值下无法裁决的声明比例。

发现。

(i)检测器在其可作用的任何地方都是可靠的:全部 27 个标记均为真正虚假声明(任何地方零误报)。(ii)其瓶颈在于目标模型的可解码性,而非检测器质量:在对照组目标模型上,63% 的 tap 前声明落在信号过于微弱而无法自信读出的槽位中,因此对 733 条谎言的召回率为 3.7%。(iii)在 RECAP 目标模型上,tap 前的谎言问题在源头消失(1,200 条中 0 条虚假声明,与传播结果一致),弃权率降至 0%:审计者的处境从“无法检查其中大部分”变为“全部验证通过”。(iv)两个目标模型上的 tap 后声明均 100% 弃权,这是正确的,因为激活中可证明不存在的内容无法通过读取激活来裁决;捕捉这些虚构内容正是接地交叉验证的工作。正文中使用的一句话总结:验证覆盖率受可解码性约束,而 RECAP 将 tap 前覆盖率从 37% 提升至 100%。

注意事项。

一个域、一个种子、一个阈值(0.9);“可解码”指全程线性可读。

附录 C 安全实验 2:无头部微调下的可读性持久性

问题。

RECAP 训练出的可解码性,在后续丢弃探测头的训练中能否存续?真实的后训练流程正是这样做的。

实验方案。

从 RECAP Pythia-160M 检查点(类别均衡存在性,)和对照检查点出发,我们仅用语言建模损失(无探测头)在刻意偏移的语料(FineWeb(Penedo 等人,2024),与 Pile 训练分布不同)的 131M token 上对两者进行微调。训练使用 batch 、学习率 ,共 2,000 步,并在 250/1,000/2,000 步处保存快照。每个快照都用标准的新鲜探测流程重新探测:岭回归探测在不相交的留出序列块上拟合和评估,因此测量在设计上不受读取器过时影响:探测在每个快照处重新拟合,绝不沿用旧探测。K=64w=0.164×1024104

媒体内容 · 前往原文查看
RECAP 运行 对照
步数 b1 / b2 ident b4 b1 / b2 ident
0 .983 / .992 .991 .808 .768 / .796 .115
250 .827 / .849 .320 .805 .769 / .795 .151
1000 .806 / .823 .180 .810 .771 / .795 .118
2000 .789 / .812 .169 .802 .770 / .793 .136
表 3:无探测头微调期间的新鲜探测可读性。b1/b2 = 两个指定秩桶的平均 AUC;ident = 64 类身份准确率;b4 = RECAP 运行中从未被指定的桶。

发现。

RECAP 的大部分增益在 250 步内消失,到 2,000 步时接近对照基线(仍有少量残余优势)。对照运行和从未被指定的桶全程保持平稳,因此衰减是特定于被指定内容的。由于探测在每个快照处重新拟合,这是可解码性损失(线性可解码性本身在消失),严格强于漂移结果中的冻结读取器过时:在那里,信息仍然存在,重新对齐可以恢复它;而在这里,新鲜探测也失去了访问能力。部署规则:RECAP 是持续成本,而非一次性购买;扫描定价使其以 nats 持续运行(配对 95% CI ,各 3 个种子),用于 。+0.010[0.015,+0.034]K=64

后续运行。

另外两次运行解决了显而易见的疑问。在未见过的同分布数据(与训练、验证或探针数据均无重叠的全新 Pile token)上进行无头微调时,可解码性的退化情况完全相同(第 2,000 步时 b1/b2/ident 与移位运行一致),因此这种退化是移除注意力头本身所固有的,而非语料偏移效应。在移位微调过程中每十步施加一次头损失,可保留大部分可解码性(第 2,000 步时约为 ,自第 250 步起大致稳定),因此以十分之一的频率进行间歇性监督即可获得大部分保护效果。原始训练日志还显示,可读性建立得较为缓慢(第 400 步后恒等损失仍接近随机水平),因此事后建立这种可读性是一项实质性工作,而非快速修补:维护优于修复。.790/.811/.151.789/.812/.169.849/.900/.891w=0.1

注意事项。

每次运行仅使用单一随机种子;共 2,000 步;间歇性运行自身的语言建模代价未单独测量(相关论断仅涉及监督频率)。

附录 D 合成领域

两个沙盒领域都是基于封闭词表的模板化语法:生成一个故事时,先为每个槽位采样一个值,再用随机填充句格式化固定模板,因此每个故事都有精确的真实元组,且所有审计量无需评判者即可计算。

领域 1(故事)。

五个槽位:姓名(20 个取值)、地点(12 个)、物品(12 个)、活动(8 个)、结局(8 个)。姓名、地点和物品在“轻拍”之前被提及;活动和结局仅在“轻拍”之后出现。“轻拍”句是固定文本,因此“轻拍”在每个故事中都位于相同的 token 偏移位置。槽位设计决定了“轻拍”激活所能包含的内容:姓名在“轻拍”后被复用(目标模型必须将其跨段携带,即保留);地点和物品在其之前结束(即淡化);活动和结局从不先于其出现(即未读取,可证明不存在,作为不可能性对照)。

领域 2(市场)。

一个为外部效度而设计的结构偏移域:五个不同规模的词表(顾客 20、商店 10、商品 14、支付 6、结果 10),每个故事有两种模板变体,以及一个可变的标记位置(标记前填充长度随模板变化)。顾客、商店和商品位于标记之前;支付和结果位于其后。流程中的其他一切均按域参数化且保持不变。

媒体内容 · 前往原文查看
域 1(故事) 域 2(市场)
槽位(标记前/后) 3 / 2 3 / 2
词表大小 20/12/12/8/8 20/10/14/6/10
模板 1 2
标记位置 固定 可变
表 4:两个合成域。

目标模型是 8 层 Transformer,在 120,000 个故事上从头训练;标记在 8 层中的第 4 层被读取。域 2 的目标模型达到了与域 1 相同的训练困惑度(1.304),并且涌现记录中的每一个现象都能跨域迁移(表 5)。d=256

媒体内容 · 前往原文查看
现象 域 1 域 2 总计
编码,标准 3/3 2/2 5/5
编码,RECAP(5 个种子) 0/3 0/2 0/5
编码,RECAP 剂量(种子 1) 0/3 0/3
RECAP 上限 1.0 3/3 2/2 5/5
传播 3/3 2/2 5/5
表 5:跨域涌现记录:展示各现象的运行。剂量变体是域 1 种子 1 上的三个部分指定级别(— = 未运行)。

图 3 展示了一个具有代表性的留出故事,以及标准和 RECAP 目标模型产生的解释。

Refer to caption
图 3:一个具有代表性的留出故事,两个目标模型(种子 1)。每个陈述的具体内容都根据精确元组被标记为真或假,并进行翻转接地(;在 处接地)。对照解释在 处通过测试(单样本得分;运行级均值为 0.71–0.86),而重建依赖于三个虚假声明(编码);RECAP 训练的模型在每个标记前槽位上的解释均接地且为真,其标记后的虚假声明也显示出接地性。Δr~τ=0.05r~=0.940

附录 E 已发布系统审计详情

设置。

所有已发布系统的测量均使用公开的 Qwen-2.5-7B 第 20 层 AV/AR 对,在分布内网络文本上进行,采用贪心解码和仅方向重建。最小对编辑来自一个固定修订版的开源评判器,并带有逐编辑有效性过滤(附录 A);每个声明的重建增量都被持久化( 基础系统声明)。n=1,517

媒体内容 · 前往原文查看
变体 τ=0.02 τ=0.05 τ=0.10
基础 0.042 0.021 0.016
RAFT 0.046 0.025 0.017
RL 0.042 0.020 0.014
表 6:在已发布系统上,LLM 相关具体主张的落地比例,按翻转阈值与训练变体划分。受灵敏度限制的下界;详见正文。τ

各阈值下的逐项落地比例(上表)具有阈值稳定性,且训练变体在每个阈值上都落在基础系统的 bootstrap 区间内。基础系统 bootstrap 95% 区间在 处为 3.2–5.2% / 1.5–2.9% / 1.0–2.2%。翻转噪声底低于最小阈值: 的第 95 百分位为 0.017,且在经验零分布中,错误方向的 下降以 的速率发生。可解码性上限:输入细节可从单位置残差向量中解码,在读取层的偶然校正值为 ,且该数值在 16–27 层及所有前缀位置上保持不变;均值池化时要点读取最高可达 50%。我们评估过的最强训练读出器(重建族 AR 本身)未超过岭回归上限。范围说明:这些上限数字仅约束重建式读出器;模型自身的反嵌入层会以下一 token 形式看到后期层细节(下文量化)。ττ=0.02/0.05/0.10|Δr~|0.022×1046%

工具有效性控制。

三项控制验证了审计工具本身(598 段分布内文本,位置 )。下限:针对不匹配激活评分的重建给出平均中心化余弦为 ,因此 中的下限归一化已校准,不匹配对坍缩至偶然水平。输入回显:解释在 处针对原始输入前缀和改写前缀重建其激活,分别为 和 ,因此解释携带的信号远超复述输入(重建器对解释风格文本的特化只解释了该差距的一部分,而非主要部分)。变换剖面(表 7):该分数在保留意义的改写下得以维持,在内容词被掩码时坍缩,这是意义级解码的特征;表层形式编码会呈现相反模式。这是直接证据,表明承载已发布系统分数的是要点而非措辞。500.001r~r~=0.840.270.24

媒体内容 · 前往原文查看
的变换z r~ 保留比例
无(原始) 0.84 1.00
改写 0.75 0.89
同义词替换 0.70 0.83
掩码功能词 0.72 0.85
词序打乱 0.32 0.37
掩码内容词 0.04 0.04
表 7:在解释(已发布系统)的变换下保留的重构结果。保持语义的改动不会改变得分;删除实义词则会破坏得分。

深层库存。

对于每个被审计的虚假声明,若其存在一个干净的单 token 真值(),我们会在每一层的两种读出方式中对这个值进行排序:模型自身的 logit lens(最终归一化 + 反嵌入)以及一个容量匹配的文档折叠岭回归探针(表 8)。模型自身的读出在第 27 层将遗漏值排进词汇表前 50 的概率是读出层的 17 倍(从 0.6% 到 10.1%),而通用训练探针则保持平稳,因此深层信号存在于模型自身的输出基中。因此,读取更深的层是一个真实但有限的手段:恢复率峰值接近 10%,因此大多数遗漏的具体信息在这些读出方式下无法在堆栈的任何位置恢复。我们按输出位置对隐藏状态进行索引(嵌入层为 0),因此第 20 层的接入点在表 8 中对应索引 21;可解码性扫描(16–27)使用相同的索引。n=316

媒体内容 · 前往原文查看
logit lens 前 50 岭回归探针前 50
15 0.000 0.054
21(读出层) 0.006 0.047
24 0.035 0.044
26 0.073 0.051
27 0.101 0.060
表 8:按层和读出方式(已发布系统,虚假声明)排入词汇表前 50 的遗漏真值占比。n=316

一个对照设计的教训。

上限探针的阴性对照(针对不同文档的激活来评分探针)最初因偏移一行而落在随机水平之上,达到 0.163,因为相邻行往往是同一文档的两个位置,编码了相同的具体信息;偏移半个数据集后则恢复为精确的随机水平。我们报告这一点,是因为近似重复的对照是此类审计容易自我高估的一个常见途径。

附录 F 对抗性监控器:谎言阶梯

问题。

如果部署方将重构得分视为真实性信号,那么一个编辑解释以最大化漏过虚假声明的报告空间对抗者能否绕过该信号,而激活探针监控器能否在该对抗者面前存活?r~r~

协议。

对 Pythia-160M(平衡版)进行 RECAP 并设置对照组。在保留的测试样本上,我们取诚实言语化生成结果,并针对每个陈述词将其编辑为一个不存在的 top-64 词(即“真实变虚假”的谎言)。随后我们通过真实重构器对编辑后的文本重新计算,并使用外部真实存在性探针(在训练样本上训练,从未接触言语化输出)对谎言进行评分。对抗强度逐级递增:L1 为随机不存在的词;L2 为嵌入空间最近的不存在词;L3 为所有候选中每个声明的最优不存在词(编辑族中最强的博弈型谎言);以及作为威胁模型之外的最坏情况边界,L4 为探针感知型对抗者,它假设私有监控器泄露,并在保持与诚实结果接近的不存在谎言中,挑选探针最易误判为存在的那个。预算超过最强纯评分谎言(L3)评分成本的两倍,因此 L4 是刻意放宽的保守边界,而非精细调校的容差。解耦设计(正面项为任何真实存在的词;编辑槽为言语化器所陈述的词)使两条分支均具有充分统计效力:RECAP 为 ,对照组为 ;诚实 / 。基于编辑,无强化学习。K=64r~argmaxr~r~r~0.050.050.022==n=758n=200r~0.3040.275

媒体内容 · 前往原文查看
对抗强度层级 RECAP AUC / 召回率 对照组 AUC / 召回率
L1 随机 0.993 / 0.99 0.729 / 0.06
L2 嵌入邻近 0.971 / 0.93 0.635 / 0.06
L3 最优r~ 0.952 / 0.86 0.508 / 0.01
L4 探针感知∗ 0.909 / 0.70 0.242 / 0.00
表 9:谎言阶梯:在报告空间中针对强度递增的对抗者的探针监控器 AUC 和标记召回率(在 精确率下),RECAP 与对照组对比。在最优层级上,两条分支的谎言惩罚几乎消失(在陈述的真实词上,最优谎言仅将 RECAP 降低 ,置信区间 ,而随机谎言则降低 );RECAP 探针保持有效,而对照组探针降至随机水平。∗L4 是报告空间威胁模型之外的探针感知型选择对抗者(它假设私有监控器泄露),作为最坏情况边界报告:它仅将 RECAP 监控器降至 AUC ,同时将对照组反转至低于随机水平的 。0.9r~Δr~0.022[0.017,0.027]0.1730.9090.242

研究结论。

(i)在 L3 层级上几乎已被“玩穿”:面对一个明确标注为真实的词,最优谎言能抑制随机谎言所遭受惩罚的 87%(RECAP,置信区间 CI)。(ii)RECAP 探针仍保持判别力(AUC 0.952),而对照探针则与随机猜测无异(0.508):稳健的监控要求内容可被解码,这正是 RECAP 所提供的;仅仅定位在可编辑报告之前就已存在的信号上的探针是不够的。(iii)选择泄漏很小(RECAP AUC 沿层级逐级下降):对分数操纵的免疫是结构性的,对候选选择的免疫则是经验性的。(iv)一个具备探针感知能力的选择对抗者(L4,超出威胁模型范围,假设监控器泄漏)仅将 RECAP 降至 AUC(召回率),而对照探针则跌至随机水平以下;低于随机水平的值是白盒攻击的预期特征——该攻击会选择这个弱对照探针过度评分的缺失词,而非异常现象。因此,对抗者越强,RECAP 与对照之间的差距就越大(L1 时为,L4 时为),这与 RECAP 的探针余量吸收了对照探针所缺乏的选择压力这一结论一致。r~Δr~0.022[0.017,0.027]0.9930.9520.9090.700.2420.270.67

注意事项。

报告空间对抗者;一个具备探针感知能力的报告空间选择对抗者被作为最坏情况边界进行测试(L4)。激活层面的攻击(对目标进行探针感知训练、输入扰动)——这类攻击移动的是激活本身,而非选择要陈述哪个词——仍不在讨论范围内(正文)。对声明的不敏感性是“几乎”而非“字面意义”上的:残余效应是一种聚合效应,不存在实际可用的逐实例信号。r~

反循环性:冻结阈值与留出区间。

由于监控器探测的是与 RECAP 所监督的相同的 top-64 存在性谓词,因此增加了两项测试,以检验它是否仅仅是在重新测量已训练的余量(审计探针,在双倍 下复现头条结果)。(a)冻结阈值。在不相交的划分上校准 -precision 标志阈值,得到 RECAP 召回率(L3)/(L4),与评估调优的 / 一致,因此工作点并未因评估而虚高;即使面对随机(L1)谎言,也没有任何对照阈值能达到 precision,因此对照召回率是未定义的,而不仅仅是偏低。(b)留出区间。当我们监控排名 64–128 的词的存在性时(RECAP 头从未监督过这些词),RECAP 的优势消失了(表 10)。n=2800n0.90.8780.7320.860.700.9

媒体内容 · 前往原文查看
对抗者层级 RECAP AUC 对照组 AUC 差距
L1 随机 0.661 0.702 0.041
L2 嵌入邻近 0.633 0.662 0.029
L3 最优r~ 0.546 0.585 0.039
L4 探针感知∗ 0.290 0.226 +0.064
表 10:保留词带(排名第 64–128 的词,从未被监督):RECAP 监控器在未指定词汇上相比对照组没有任何优势。诚实情形下的 AUC 为溢出效应留下了显现空间,而 Hanley–McNeil 标准误具备检测上述差距的统计功效(比受监督差距低一个数量级),因此这是一个有功效的零结果;L1 对照组的点估计值略高于 RECAP,但不显著()。∗L4 超出威胁模型范围。0.660.700.070.230.64p0.10

该词带零结果仅限于此接入点上的线性可解码性,并非该词带在模型中不存在的证据。冻结阈值是同一运行的不相交切分,而非时间上留出的部署阈值。词带分支未配对。因此,指定既是机制也是范围:RECAP 使得关于指定内容的谎言在精度受控的工作点上可被检测,并且对指定词汇之外的声称不提供任何保护。

附录 G 一种无需 API 的接地信号,以及一个选择零结果

翻转工具需要一名评判者为每条声称编写一个最小对编辑。一种更廉价的信号则无需任何评判者:用中性填充词掩盖声称中的词语,并用冻结重建器重新评分解释。在附录 A 的评判者正面比较中,这种掩码-重评分信号与翻转工具在经验证的开放评判者下达到 AUC 0.997 的一致性,因此每条声称的接地性可以在推理时通过一次额外的冻结读取器传递来监控,而无需评判者参与循环。该实验的早期版本还报告了过滤器精度和接地基率;这些数据依赖于验证前的翻转标签,而有效性审计后来发现其中约三分之一被过大编辑污染(附录 A)。因此我们仅报告在经验证评判者下测得的一致性数字,并撤回其余数据。污染仅限于那些被撤回的量:论文中保留的每个数字均晚于有效性过滤器。

推理时选择所不能带来的。

由外部真值评判器(特异性匹配、独立评判)进行 best-of-n 选择,仅将错误声明率从 0.747(随机抽样)降至 0.688:忠实解释在样本邻域中极为罕见,因此选择无法触及它们。NN=5

附录 H 读者漂移与重新对齐

与训练目标模型匹配的读者在 1,500 步持续训练步数内衰减至接近随机水平(3/3 个种子),且跨种子间读取不到任何信息(6/6 对)。然而,信息仍然可以被精确恢复:在 7,000 对激活(无标签)上拟合的线性映射在 9/9 种情况下恢复了读者原有的性能。按表达能力类别分解该映射,覆盖三组读者对(两组跨种子、一组过期):秩 1 和秩 4 映射几乎无法恢复任何信息,纯旋转(Procrustes)恢复约一半,而秩 16–64 的非正交变化则恢复了几乎全部信息。坍缩则截然不同:在坍缩情况下,新训练的探针同样失败,因此不存在重新对齐的可能。

Refer to caption
图 4:恢复失效读者所需的条件:通过表达能力递增的无标签映射恢复的准确率,涵盖两组跨种子对和一组过期(同种子、更晚检查点)案例。仅靠旋转可恢复约一半;秩 16–64 的非正交变化可恢复几乎全部信息。

附录 I 消融索引

媒体内容 · 前往原文查看
因素 测试范围 结果 位置
目标数K 8/64/512 税负增加;朴素 512 失败 §5.3
辅助权重w 1.0–0.03 0.03 时恒等映射自由 §5.3
存在性损失 朴素/均衡 均衡修复两者 §5.3
拉取强度 λ=0–10 所有强度下均坍缩 §4
指定剂量 1–3 个槽位 任何剂量均可防止代码 §5.2
重新对齐映射 秩 1–全秩 旋转恢复一半 附录 H
评估器 联合训练/独立 代码接地坍缩 §3.2
领域 故事/市场 所有现象均可迁移 §5.2
种子 3+2(沙盒) 所有声明均可复现 §3–5
微调持久性 0–2000 步 250 步内侵蚀 附录 C
z变换 5 种类型 要点承载分数 附录 E
读取层 15–27 前 50 恢复率 0.10 附录 E
best-of-nN N=5 错误率从 0.75 降至 0.69 附录 G
头部容量 线性/MLP 可解码性不变 下方
抽取层 6 / 9 在 9 层复现 下方
读者规模 0.5B/3B 真值不变 §5.4
RAFT 轮次 重建奖励 分数上升;RECAP 持平,对照组下降 §5.4
读者奖励 重建/真值 两者均不提升真值 §5.4
注入 1/6 个 token 解码点信息被恢复 §5.4
负监督。 开/关 精度不变 §5.4
表 11:程序中变化的配方选择、测试的取值以及结果报告的位置(除非另有说明,均为主文章节);下方区块列出了可言语性结果(§5.4)背后按规模划分的读取端消融实验。

主文中未详述的因素。

拉动强度(–):在所有设置下均崩溃。指定剂量(1–3 个槽位):在任何剂量下编码均被阻止。重对齐映射类别(从秩 1 到全仿射):图 4。评估器(联合训练 vs. 独立):在独立评估器下代码接地崩溃。领域(故事 vs. 市场):所有现象均可迁移(跨领域台账表,主文)。头部容量(、均衡、):非线性 MLP 头部在第 6 层达到指定探针 AUC 0.98–0.99(税 ),与线性头部相当。抽取层:第 9 层的线性头部将 AUC 从 0.77–0.79(对照)提升至 0.95–0.98(在 nats 下),因此可解码性并非第 6 层抽取所特有。未变化:超过 160M 参数的模型规模。λ=010K=64w=0.1+0.09+0.01

辅助权重扫描()。K=64

表 12 按目标类型(每个点单一种子)拆分了规模上的可解码性代价:身份目标从 降至 时仍保持可读,其中留出税在零噪声范围内,而朴素存在目标在 以下立即失去可读性。在此精度下,单一种子税在 上呈非单调性。w=1.0w=0.03w=1.0w

媒体内容 · 前往原文查看
w 税(nats) 存在 身份
1.0 +0.064 0.95–0.97 1.000
0.3 +0.027 0.79–0.81 1.000
0.1 +0.052 0.79–0.81 0.997
0.03 0.003 0.79–0.81 0.953
表 12:在 (朴素存在损失)下的辅助权重扫描,每个点单一种子。税与共享对照在 20M 留出 token 上的比较;存在 = 平均 AUC,范围覆盖两个指定秩桶(非种子或置信区间);身份 = 64 类准确率。K=64

章节编号(§)指主论文;“App.”引用指本附录的章节。单一种子因素(规模实验、安全实验)在报告处均已标注。

附录 J 规模言语化审计协议

尺度传播结果(§5.4)对一对 AV/AR 组合进行了审计,该组合使用已发布配方(recipe)的结构在 Pythia-160M taps 上训练。读取器(Reader):一个 0.5B 参数的语言模型,带有 LoRA 适配器(秩 16)和一个线性维度适配器,将 768 维的 tap 状态映射到读取器的嵌入宽度,激活值在标记位置以范数匹配方式注入。训练:基于固定模板生成的金标准描述进行冷启动 SFT,模板陈述尾随窗口内容词以及往回数第八个位置处的 token,然后交替进行重建器拟合和两轮针对重建奖励的拒绝采样。两种条件使用相同的流程;只有底层目标模型(RECAP 与对照)不同。审计:每种条件从探针区域取 400 个保留的 taps;解释被模板解析为陈述的上下文词和陈述的 token-at-。一个陈述词为真,当且仅当它出现在尾随 64-token 窗口中(精确匹配,自监督,无裁判);接地翻转(grounding flips)将一个陈述词替换为另一个前 64 词汇表中的词,并在共同训练的重建器下进行测量。区间为 tap 聚类的 bootstrap 95% 区间(对 taps 及其声明进行 10,000 次重采样):RECAP 模型为 0.385–0.506,对照为 0.040–0.085。解析器每条解释最多输出三个声明,但此处每条 tap 最多共享两个声明,因此这些区间几乎不会比未聚类的 Wilson 区间(0.384–0.506 / 0.042–0.089)更宽。表 13 给出了正文数字背后的完整读数。8Δr~

Refer to caption
图 5:在规模上(Pythia-160M,指定内容),可解码性超过可言语化性。一个全新的探针读取重建器解码点的隐藏状态(黑色),在各操作点上都能恢复指定内容;重建言语化器(reconstruction verbalizer)生成的精确率–召回率曲线(绿色,两个重建器种子)位于其下方,其操作点接近 0.60 精确率。内容存在且可被探针解码;自由形式生成只传达了其中一部分。对照言语化器(灰色)处于最低水平。
媒体内容 · 前往原文查看
指标(每种条件 400 个 taps) 对照 RECAP
陈述词声明数 406 252
词真实性 0.062 0.444
词接地 @τ=0.02 0.48 0.78
词接地 @τ=0.05 0.29 0.65
词接地 @τ=0.10 0.15 0.47
接地减真实差距 +0.42 +0.33
token-at- 真实性8 0.043 0.039
token-at- grounded @8τ=0.05 0.32 0.43
均值r~ 0.19 0.24
表 13:量表口头化审计,完整读数(每种条件一个随机种子)。对照组复现了“已落地且虚假”的特征;RECAP 模型陈述真实词汇的频率明显更高(0.44 对 0.06)。偏移 8 的真实性和落地性是在所有点击上计算的,但真正的偏移 8 token 仅在 2.2% 的点击中被指定为前 64 目标();其接近零的真实性是基率伪影(口头化器被训练为在每次点击时都输出一个声明),样本太少无法刻画,因此我们将其报告为“未恢复”而非“代码”。n9

对重构器强度的稳健性。

在相同目标模型上,用更强的 AV/AR 对(LoRA 秩 32、更多 SFT、重构器和拒绝采样轮次)重新训练,均值提升至 0.208(对照组)和 0.300(RECAP)。差距在两个维度上都成立:RECAP 陈述真实词汇的比例为 0.574 对 0.152,并且在共享的 381 个出现词汇上,以 0.470 对 0.037 的召回率恢复它们;对照组陈述的词汇更少(92 对 312),但在精确率和召回率上均落后,因此其更高的真实率是选择性所致。偏移 8 的真实性再次接近零(0.028/0.026),与其 2.2% 的可存储点击基率一致,而非代码。结果在不同随机种子间也保持稳定:在三个类别均衡的 RECAP 目标模型种子上,陈述词汇的真实性为 0.444、0.455、0.443,而三个对照 NLA 种子为 0.062、0.060、0.000。r~

可解码性超过可口头化性(读数重新设计)。

为了定位言语化器(verbalizer)的“真实”与“水龙头”中所含内容之间的差距,我们首先将言语化器置于拟合探针的精确率-召回率曲线上:在言语化器自身的召回率水平上,探针达到了相应的精确率(指定内容 AUC 0.99),而言语化器生成的精确率仅为 0.44–0.63。公平的比较是 AUC 与精确率之间的不匹配,而非字面上的“差距”。随后我们重建了读取器:采用标准化(而非逐样本去范数)注入,通过 MLP 适配器注入六个 token,使用 MLP-LoRA,并在精确的窗口出现标签(外部真实标签,绝非学习型监控器)上训练一个解码点存在性头。这使得指定内容可以从读取器自身最后一个提示的隐藏状态中线性读取(两个随机种子),但其生成精确率仍为——;一个匹配的对照组在相同点、相同头下读取。逐词置信度扫描显示,言语化器的生成式 PR 曲线完全位于探针曲线之下(图 5)。读取器规模(0.5B 对比 3B)、RAFT 重建奖励、直接真实奖励、注入带宽以及显式负监督均被逐一尝试,但无一能提升生成精确率,因此这一残余差异与“通过生成来序列化稀疏叠加特征”的成本一致,而非信息缺失所致。0.800.990.570.790.810.560.630.03

附录 K 超参数与可复现性说明

规模实验(Pythia-160M)。

在 pile-uncopyrighted 数据集上继续预训练,每次运行 500M tokens,各次运行的数据与顺序完全一致;批处理 tokens,AdamW(余弦衰减至 10%,warmup 100,权重衰减 0.01,梯度裁剪 1.0),bf16 自动混合精度配合 fp32 权重。探测头:在第 6 层隐藏状态上使用线性层。存在性目标使用 BCE,在 上取平均;类别平衡变体按经验逆窗口基率对正样本加权,上限截断为 100,该基率由前 2M 训练 tokens 估计得到。身份目标使用偏移量 处 top- 内容词汇表上的交叉熵。全新探测:在固定 下按秩桶进行闭式岭回归,在前 80% 的留出探测序列上拟合,并在最后 20% 上评估(不相交的连续块;长文档可能跨越边界);身份探测为 64 类逻辑回归。早期版本按评估集 AUC 从 中逐桶选择;使用固定 的完整重跑可将每个报告的桶 AUC 复现到小数点后三位,因此报告数字中不存在选择偏差。优化器超参数(学习率、warmup、权重衰减、梯度裁剪)固定为标准值且未做扫描;方法专属超参数(辅助权重、目标数量 、指定剂量、探测层、头容量)才是被调整的变量,其范围与选择规则见消融索引。留出语言建模损失在 20M tokens 上测量。全程显著性评估采用 95% 自助法置信区间和不相交区间比较(对留出带零假设进行 Hanley–McNeil 功效分析),而非固定水平的假设检验。所有实验在 Modal 平台上的单块 NVIDIA A100-80GB GPU 上运行(Debian-slim,Python 3.12;PyTorch、Transformers、Accelerate 和 NumPy,确切版本已在发布的环境文件中锁定)。设置过程中发现的一个注意事项:近期库默认会原生加载 fp16 检查点,而 fp16 下的 AdamW 会因 epsilon 下溢在单步内摧毁所有权重,同时损失和梯度仍显示为有限值;所有运行均强制使用 fp32 参数。64×1024104KK8λ=104λ{10,102,103,104}λK

沙盒运行。

两个合成领域(故事;市场)使用封闭词汇表;目标模型是8层、从头训练的Transformer;玩具NLA使用一个0.5B参数的AV/AR对,配备维度适配器、范数匹配的激活注入、基于完整故事描述的冷启动SFT,然后交替进行重构器拟合和基于重构奖励的拒绝采样轮次(即发布配方中的结构)。审计通过精确的封闭词汇扫描来解析所陈述的具体细节;接地翻转将某个陈述词替换为同类型的词汇词,并测量重构下降幅度。RECAP运行使用辅助权重0.3、3,000步、批大小128、学习率,以及30,000次探针采样。随机种子:三个(领域1)加两个(领域2);每次运行由单个整数种子控制,该种子传递给torch.manual_seed(并配有匹配的CUDA生成器用于采样),从而固定初始化、数据顺序以及随机训练和评估过程;RECAP上限通过在领域1的元组不相交划分和领域2的保留划分上独立拟合的探针进行评估。d=2563×104

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org