# HarmProfile：刻画前沿大语言模型的有害输出分布

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-06-11 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmszbz3mk0969rodp45ep34o3
- 原文链接：https://arxiv.org/abs/2608.14577

## 精选理由

将有害输出视为可分析的对象而非单一攻击结果，80k 样本的风险画像为横向比较不同模型的安全边界提供了新基准。

## AI 摘要

HarmProfile 是一个以内容为中心的基准数据集，收集了 13 个模型家族、23 个前沿 LLM 的超过 80,000 个经验证的违规样本，覆盖 15 个危害类别和 57 个子类别。研究发现，前沿 LLM 能大规模稳定产生有害内容，且不同模型呈现不同的风险画像；危害性与多样性随模型能力增长，暗示模型可能在对齐表面之下隐藏着日益危险的知识。源代码已公开。

## 正文

前沿大语言模型（LLM）的安全评估在很大程度上将有害生成视为一种攻击结果，而非分析对象。因此，人们对模型在行为异常期间产生的有害输出知之甚少，部分原因在于大规模、高质量的前沿LLM异常行为数据集难以获取。为弥补这一空白，我们引入了HarmProfile，这是一个以内容为中心的基准数据集，收集了跨多种危害类别和模型家族的模型异常行为，并将由此产生的有害输出分布定义为模型层面的风险画像。其前提是，正如语言行为可以通过话语语料库来刻画一样，模型风险也可以通过其安全失败的内容、严重程度和变化来表征。HarmProfile包含来自13个模型家族、23个前沿LLM的超过80,000个经过验证的样本，涵盖15个危害类别和57个子类别。利用该语料库，我们发现前沿LLM确实能够大规模地产生有害内容，但表现出截然不同的风险画像；有害性和多样性均随模型能力的增强而增长，这表明前沿LLM可能表面上看起来安全，但在对齐表面之下却潜藏着日益危险的知识。我们的源代码可在 https://github.com/fresh-ma/HarmProfile 获取。
