STORY · 事件已收束

Anthropic 发布 SAE干预不可靠性研究

1 个精选信源 · 1 篇报道持续 1最新动态 47天前
最新进展

SAE干预不可靠:干预后抑制行为的恢复

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. SAE干预不可靠:干预后抑制行为的恢复
    HuggingFace Daily Papers(社区热门论文)精选

    稀疏自编码器(SAE)将残差流激活分解为可解释特征,但干预特定特征后,通过优化残差扰动可恢复原有行为。研究发现这是一种可恢复失败模式:干预阻断一条可见行为路径,却未消除行为本身。即使干预在整个优化和生成期间保持激活,恢复依然可行。在TPP、遗忘、IOI和拒绝引导场景中均观察到可恢复行为。安全关键的拒绝引导场景下有效样本恢复率达95.8%,被防御特征的相对漂移仅0.131。归因分析将恢复路径定位到SAE重建残差,表明控制SAE特征并不能保证控制底层行为。

RELATED