可解释性常被视为能力的“代价”:语言模型被训练成不透明系统,事后再用可靠性难以验证的方法加以解释。在这项工作中,我们挑战了这一前提。我们不去逆向解析模型,而是把可解释性作为训练流程中的一项约束,与语言建模目标一同优化。在跨越三个数量级的算力规模上,无论是自回归还是扩散语言模型,可解释性都随能力同步提升,而非与之相悖。令人意外的是,模型表征随规模扩大而变得更加解耦,并与人类可理解的概念更加对齐。我们用 Steerling-8B 实例化了这一训练时方案——这是一个带有因果注意力掩码的扩散语言模型。对于任意一组生成 token,Steerling-8B 都能将输出归因到相关输入 token、人类可理解的概念以及训练数据。这实现了闭环干预:通过概念或特征归因诊断输出,检索相似训练数据,并通过概念引导修正行为,而无需重新训练。Steerling-8B 在竞争力上与使用 2-16 倍算力训练的开源同类模型相当,这暗示了一种不同的扩展范式:可解释性可以被设计进训练过程,并随规模扩大而持续改善。
可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程
一项新研究挑战“可解释性牺牲能力”的假设,将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内,自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预,且与算力多 2-16 倍的开放模型保持竞争力。
可解释性常被视为能力的“代价”:语言模型被训练成不透明系统,事后再用可靠性难以验证的方法加以解释。在这项工作中,我们挑战了这一前提。我们不去逆向解析模型,而是把可解释性作为训练流程中的一项约束,与语言建模目标一同优化。在跨越三个数量级的算力规模上,无论是自回归还是扩散语言模型,可解释性都随能力同步提升,而非与之相悖。令人意外的是,模型表征随规模扩大而变得更加解耦,并与人类可理解的概念更加对齐。我们用 Steerling-8B 实例化了这一训练时方案——这是一个带有因果注意力掩码的扩散语言模型。对于任意一组生成 token,Steerling-8B 都能将输出归因到相关输入 token、人类可理解的概念以及训练数据。这实现了闭环干预:通过概念或特征归因诊断输出,检索相似训练数据,并通过概念引导修正行为,而无需重新训练。Steerling-8B 在竞争力上与使用 2-16 倍算力训练的开源同类模型相当,这暗示了一种不同的扩展范式:可解释性可以被设计进训练过程,并随规模扩大而持续改善。
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org