RAG投毒可致注意力崩溃,检测需关注文档级注意力

Rohan Paul · @rohanpaul_ai · X·2026-08-31 13:47·19分钟前
AI 导读

研究发现,恶意检索文档可提升模型token置信度与输出一致性,导致基于不确定性的检测器失效。作者将攻击下注意力集中于投毒文档而非分散于检索证据的现象称为“注意力崩溃”(Attention Collapse)。因此,仅检查最终答案或置信度可能漏报,监控检索文档间的注意力分布或可提前暴露投毒。

Rohan Paul@rohanpaul_ai
45AI 编辑部评分,满分 100

RAG投毒可致注意力崩溃,检测需关注文档级注意力

2026-08-31 13:47· 19分钟前
AI 导读

研究发现,恶意检索文档可提升模型token置信度与输出一致性,导致基于不确定性的检测器失效。作者将攻击下注意力集中于投毒文档而非分散于检索证据的现象称为“注意力崩溃”(Attention Collapse)。因此,仅检查最终答案或置信度可能漏报,监控检索文档间的注意力分布或可提前暴露投毒。

RAG poisoning can make a model more confident, which is exactly why confidence-based detectors can fail.

This paper finds malicious retrieved documents can increase token confidence and output consistency.

So uncertainty-based detectors can miss the attack because poisoning can create false confidence.

Under attack, attention becomes concentrated on poisoned documents instead of staying spread across the retrieved evidence.

The authors call this Attention Collapse.

So for RAG security, checking only the final answer or its confidence may miss the warning.

Monitoring how attention is distributed across retrieved documents could expose poisoning before the answer visibly breaks.

– arxiv. org/abs/2608.06947

Title: "When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse"

来源:Rohan Paul· x.com