HarmProfile:刻画前沿大语言模型的有害输出分布

HuggingFace Daily Papers(社区热门论文)·2026-06-11 08:00·80天前
AI 导读

HarmProfile 是一个以内容为中心的基准数据集,收集了 13 个模型家族、23 个前沿 LLM 的超过 80,000 个经验证的违规样本,覆盖 15 个危害类别和 57 个子类别。研究发现,前沿 LLM 能大规模稳定产生有害内容,且不同模型呈现不同的风险画像;危害性与多样性随模型能力增长,暗示模型可能在对齐表面之下隐藏着日益危险的知识。源代码已公开。

HuggingFace Daily Papers(社区热门论文)
精选
74AI 编辑部评分,满分 100

HarmProfile:刻画前沿大语言模型的有害输出分布

2026-06-11 08:00· 80天前
AI 导读

HarmProfile 是一个以内容为中心的基准数据集,收集了 13 个模型家族、23 个前沿 LLM 的超过 80,000 个经验证的违规样本,覆盖 15 个危害类别和 57 个子类别。研究发现,前沿 LLM 能大规模稳定产生有害内容,且不同模型呈现不同的风险画像;危害性与多样性随模型能力增长,暗示模型可能在对齐表面之下隐藏着日益危险的知识。源代码已公开。

推荐理由

将有害输出视为可分析的对象而非单一攻击结果,80k 样本的风险画像为横向比较不同模型的安全边界提供了新基准。

正文 · AI 翻译

前沿大语言模型(LLM)的安全评估在很大程度上将有害生成视为一种攻击结果,而非分析对象。因此,人们对模型在行为异常期间产生的有害输出知之甚少,部分原因在于大规模、高质量的前沿LLM异常行为数据集难以获取。为弥补这一空白,我们引入了HarmProfile,这是一个以内容为中心的基准数据集,收集了跨多种危害类别和模型家族的模型异常行为,并将由此产生的有害输出分布定义为模型层面的风险画像。其前提是,正如语言行为可以通过话语语料库来刻画一样,模型风险也可以通过其安全失败的内容、严重程度和变化来表征。HarmProfile包含来自13个模型家族、23个前沿LLM的超过80,000个经过验证的样本,涵盖15个危害类别和57个子类别。利用该语料库,我们发现前沿LLM确实能够大规模地产生有害内容,但表现出截然不同的风险画像;有害性和多样性均随模型能力的增强而增长,这表明前沿LLM可能表面上看起来安全,但在对齐表面之下却潜藏着日益危险的知识。我们的源代码可在 https://github.com/fresh-ma/HarmProfile 获取。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org