这是一则列表来源,站内未收录完整正文。
Apple Machine Learning Research(RSS)
苹果研究:单个神经元即可绕过大型语言模型的安全对齐
精选理由
苹果发现单个神经元足以绕过大模型安全对齐,在7个模型上验证了攻击,说明安全机制并非稳健分布,做安全攻防的必读。
AI 摘要
苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。
这是一则列表来源,站内未收录完整正文。
阅读完整原文machinelearning.apple.com