精选归档 · 第 27 页
第 521–523 条 · 共 523 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
2024年4月机制可解释性研究动态与团队招聘计划Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。
推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
Transformer残差流中的特权基向量研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。
推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
Transformer电路逆向工程练习题集本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。
推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。