HuggingFace Daily Papers(社区热门论文)
精选
80AI 编辑部评分,满分 100

个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

2026-08-05 08:00· 1天前
AI 导读

一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%–49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。

推荐理由

12个主流LLM在个性化时平均有41.8%的推断是凭空编造的,且模型自己报告的过度推断程度与实际测得的程度呈负相关,打破了依赖自审来评估模型可信度的做法。

正文 · AI 翻译

具有持久化记忆的个性化大语言模型正被越来越多地部署,但其用户模型的忠实度仍未得到检验。我们研究了过度推断(OI)现象:即大语言模型在证据支持范围之外捏造用户属性的行为。我们推出了 MirageBench,包含 150 个在刻板印象、反刻板印象和中性画像之间均衡分布的人物画像,6 项覆盖“想象梯度”的个性化任务,一个由独立评判器(在 400 条声明上与盲法人工标注者进行了验证:四分类 Cohen's kappa = 0.863,二分类 kappa = 0.900)操作的四维忠实度分类体系,以及一个涵盖 7 个模型家族共 12 个模型、基于 143616 条已评判声明的排行榜。我们发现过度推断普遍存在:全部 12 个模型中有 35%–49% 的声明存在过度推断(跨模型均值 41.6%;按声明加权 41.8%),本次评估中没有任何模型能够幸免。最引人注目的是,我们发现了一种“自我监控反转”现象:在模型选择层面,模型的自我评估 OI 与其评判器测量的 OI 呈负秩相关(rho = -0.60,p = 0.044;探索性结果,宽 bootstrap 置信区间 [-0.90, +0.06],n = 12)。自我报告过度推断最少的模型往往被标记为捏造最多的模型,因此自我报告的信心在比较模型时是一个具有误导性的信号——尽管在单个模型内部,自我审计仍能对其自身声明进行中等程度的排序(AUROC 0.58–0.83)。我们进一步表明,OI 具有任务依赖性(27%–59%),并且在多轮试点中,推断出的属性近似线性累积,且很少被修正。MirageBench 将外部验证而非模型自我报告定位为可信个性化更可靠的基础。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

HuggingFace Daily Papers(社区热门论文)·2026-08-05 08:00·1天前
AI 导读

一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%–49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。

正文 · AI 翻译

具有持久化记忆的个性化大语言模型正被越来越多地部署,但其用户模型的忠实度仍未得到检验。我们研究了过度推断(OI)现象:即大语言模型在证据支持范围之外捏造用户属性的行为。我们推出了 MirageBench,包含 150 个在刻板印象、反刻板印象和中性画像之间均衡分布的人物画像,6 项覆盖“想象梯度”的个性化任务,一个由独立评判器(在 400 条声明上与盲法人工标注者进行了验证:四分类 Cohen's kappa = 0.863,二分类 kappa = 0.900)操作的四维忠实度分类体系,以及一个涵盖 7 个模型家族共 12 个模型、基于 143616 条已评判声明的排行榜。我们发现过度推断普遍存在:全部 12 个模型中有 35%–49% 的声明存在过度推断(跨模型均值 41.6%;按声明加权 41.8%),本次评估中没有任何模型能够幸免。最引人注目的是,我们发现了一种“自我监控反转”现象:在模型选择层面,模型的自我评估 OI 与其评判器测量的 OI 呈负秩相关(rho = -0.60,p = 0.044;探索性结果,宽 bootstrap 置信区间 [-0.90, +0.06],n = 12)。自我报告过度推断最少的模型往往被标记为捏造最多的模型,因此自我报告的信心在比较模型时是一个具有误导性的信号——尽管在单个模型内部,自我审计仍能对其自身声明进行中等程度的排序(AUROC 0.58–0.83)。我们进一步表明,OI 具有任务依赖性(27%–59%),并且在多轮试点中,推断出的属性近似线性累积,且很少被修正。MirageBench 将外部验证而非模型自我报告定位为可信个性化更可靠的基础。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org