# 个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-05 08:00
- AIHOT 分数：80
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsgxbipf02reroxzm6rg0q4l
- 原文链接：https://arxiv.org/abs/2608.04570

## 精选理由

12个主流LLM在个性化时平均有41.8%的推断是凭空编造的，且模型自己报告的过度推断程度与实际测得的程度呈负相关，打破了依赖自审来评估模型可信度的做法。

## AI 摘要

一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%–49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。

## 正文

具有持久化记忆的个性化大语言模型正被越来越多地部署，但其用户模型的忠实度仍未得到检验。我们研究了过度推断（OI）现象：即大语言模型在证据支持范围之外捏造用户属性的行为。我们推出了 MirageBench，包含 150 个在刻板印象、反刻板印象和中性画像之间均衡分布的人物画像，6 项覆盖“想象梯度”的个性化任务，一个由独立评判器（在 400 条声明上与盲法人工标注者进行了验证：四分类 Cohen's kappa = 0.863，二分类 kappa = 0.900）操作的四维忠实度分类体系，以及一个涵盖 7 个模型家族共 12 个模型、基于 143616 条已评判声明的排行榜。我们发现过度推断普遍存在：全部 12 个模型中有 35%–49% 的声明存在过度推断（跨模型均值 41.6%；按声明加权 41.8%），本次评估中没有任何模型能够幸免。最引人注目的是，我们发现了一种“自我监控反转”现象：在模型选择层面，模型的自我评估 OI 与其评判器测量的 OI 呈负秩相关（rho = -0.60，p = 0.044；探索性结果，宽 bootstrap 置信区间 [-0.90, +0.06]，n = 12）。自我报告过度推断最少的模型往往被标记为捏造最多的模型，因此自我报告的信心在比较模型时是一个具有误导性的信号——尽管在单个模型内部，自我审计仍能对其自身声明进行中等程度的排序（AUROC 0.58–0.83）。我们进一步表明，OI 具有任务依赖性（27%–59%），并且在多轮试点中，推断出的属性近似线性累积，且很少被修正。MirageBench 将外部验证而非模型自我报告定位为可信个性化更可靠的基础。
