# 可解释性随规模提升：Steerling-8B 将可解释性纳入训练流程

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-06 08:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmso91prw0fd8rofw8fdiyzgr
- 原文链接：https://arxiv.org/abs/2608.07594

## 精选理由

论文打破了可解释性与能力对立的假设，验证了训练时加入可解释性约束可以让模型概念随规模自然解耦，并支持不重训的闭环干预，为可解释模型的规模化提供了新路径。

## AI 摘要

一项新研究挑战“可解释性牺牲能力”的假设，将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内，自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预，且与算力多 2-16 倍的开放模型保持竞争力。

## 正文

可解释性常被视为能力的“代价”：语言模型被训练成不透明系统，事后再用可靠性难以验证的方法加以解释。在这项工作中，我们挑战了这一前提。我们不去逆向解析模型，而是把可解释性作为训练流程中的一项约束，与语言建模目标一同优化。在跨越三个数量级的算力规模上，无论是自回归还是扩散语言模型，可解释性都随能力同步提升，而非与之相悖。令人意外的是，模型表征随规模扩大而变得更加解耦，并与人类可理解的概念更加对齐。我们用 Steerling-8B 实例化了这一训练时方案——这是一个带有因果注意力掩码的扩散语言模型。对于任意一组生成 token，Steerling-8B 都能将输出归因到相关输入 token、人类可理解的概念以及训练数据。这实现了闭环干预：通过概念或特征归因诊断输出，检索相似训练数据，并通过概念引导修正行为，而无需重新训练。Steerling-8B 在竞争力上与使用 2-16 倍算力训练的开源同类模型相当，这暗示了一种不同的扩展范式：可解释性可以被设计进训练过程，并随规模扩大而持续改善。
