Steerling-8B 发布
可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程
TIMELINE
1 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- 可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程
一项新研究挑战“可解释性牺牲能力”的假设,将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内,自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预,且与算力多 2-16 倍的开放模型保持竞争力。