苹果研究:单个神经元即可绕过大型语言模型的安全对齐

Apple Machine Learning Research(RSS)·2026-07-07 08:00·46天前
AI 导读

苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。

Apple Machine Learning Research(RSS)
精选
74AI 编辑部评分,满分 100

苹果研究:单个神经元即可绕过大型语言模型的安全对齐

2026-07-07 08:00· 46天前
AI 导读

苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。

推荐理由

苹果发现单个神经元足以绕过大模型安全对齐,在7个模型上验证了攻击,说明安全机制并非稳健分布,做安全攻防的必读。

正文 · AI 翻译

语言模型中的安全对齐通过两个机制上截然不同的系统运作:拒绝神经元(控制有害知识是否被表达)和概念神经元(编码有害知识本身)。通过针对每个系统中的单个神经元,我们在横跨两个模型家族、参数量从1.7B到70B的七个模型上,展示了两种失效方向——通过抑制绕过对明确有害请求的安全防护,以及通过放大从无害提示中诱导出有害内容——且无需任何训练或提示词工程。我们的发现表明,安全对齐并非稳健地分布在模型权重中,而是由单个神经元介导,每个神经元在因果上足以控制拒绝行为——抑制任何一个被识别的拒绝神经元,就能绕过针对多种有害请求的安全对齐。

  • ‡ 同等贡献
  • † 马里兰大学帕克分校
  • ** 在苹果公司期间完成的工作

相关阅读与更新。

VLSU:绘制面向AI安全的联合多模态理解边界

多模态基础模型的安全评估通常将视觉和语言输入分开处理,忽略了联合解读带来的风险——即原本无害的内容在组合后可能变得有害。现有方法也无法清晰区分明显不安全的内容与边缘案例,导致对真正有害内容出现过度拦截或拒绝不足的问题。我们提出了视觉语言安全理解(VLSU),一个全面的……

解耦安全适配器实现高效护栏与灵活的推理时对齐

本文已被ICLR 2026的“可信AI、可解释性、鲁棒性与跨模态安全原则设计”研讨会接收。

现有的AI安全范式,如护栏模型和对齐训练,往往在推理效率或开发灵活性上有所妥协。我们引入了解耦安全适配器(DSA),这是一个通过解耦安全特定……来应对这些挑战的新框架。

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com