单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性

HuggingFace Daily Papers(社区热门论文)·2026-08-24 08:00·1天前
AI 导读

检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性

2026-08-24 08:00· 1天前
AI 导读

检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。

推荐理由

实验量化了单页污染对 LLM 推荐器的影响,并发现推理会生成虚假社会证明,这提示搜索增强推荐系统的风险评估需覆盖推理环节。

正文 · AI 翻译

搜索增强型大语言模型(LLM)正越来越多地通过检索实时网页内容来介入日常消费推荐。这带来了一种新的风险:LLM 推荐系统可能会消费被生成式引擎优化(GEO)运营者污染的网络内容,从而被误导。我们要问:它们在多大程度上会成为虚假产品的无意推广者?我们推出了 FORGE(生成式环境中的虚假在线推荐)基准,该基准在固定的检索网页集合中,将真实产品本地改写为虚假产品,并衡量 LLM 推荐虚假产品的频率,覆盖 15 个类别、5 个消费场景下的 225 个真实产品。在 12 个商业及开源权重 LLM 中,所有模型均存在脆弱性:单个被污染的页面即可导致高达 27% 的被欺骗率,而完全替换前 3 个结果则可将该比例提升至 73.8%。脆弱性因类别而异,当模型缺乏对产品的稳定先验知识时,脆弱性会增加。推理并不能缓解这种脆弱性;相反,它常常生成虚假的社会认同来为错误推荐辩护。四种防御措施均不充分:怀疑提示(skepticism prompt)可能像推理一样加剧脆弱性,两种共识过滤器有压制合法产品的风险,而可信度重排序虽对所有模型都有帮助,但只能清除六分之一的虚假内容。我们在 https://github.com/leoluolol/forge-benchmark 发布了 FORGE 基准和评估代码。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org

arXiv搜索论文/研究