今日 / 论文

ToxicRAG:通过单次知识投毒攻击破坏检索增强生成系统

原标题:ToxicRAG: Compromising Retrieval-Augmented Generation Systems via Single-Shot Knowledge Poisoning Attacks

Haozhe Lu · Jiaqi Li · Xinyuan Zhu · Xiang Li

arxiv_safety T1

解读说明:依据 arXiv HTML 正文解读(约 20000 字)

这篇在讲什么

检索增强生成(RAG)虽然能提升大语言模型的事实准确性,但也引入了外部语料库这一新的攻击面。现有的知识投毒攻击如PoisonedRAG通常需要注入多份文档才能确保被检索到,这在攻击者仅有一次写入机会的场景下并不适用。本文旨在解决这一受限威胁模型下的攻击问题,即如何通过单份文档同时满足被检索器选中并成功改变生成器答案的双重目标。

ToxicRAG的核心创新在于其“演化范式转移叙事”(Evolutionary Paradigm-Shift Narrative)。攻击文档不再直接断言错误答案,而是模拟一个知识更新的过程:首先承认旧答案的有效性,接着虚构一个导致旧答案失效的因果事件,最后引用多个虚构的权威来源来支持攻击者选定的新答案。这种叙事结构旨在提高文档的自然度,使其更像普通语料库内容,从而规避基于困惑度或词汇相似度的简单防御。

与CorruptRAG或AuthChain等既有工作相比,ToxicRAG将因果转变与多源共识结合,并引入了一个基于代理语言模型的答案聚焦自验证循环。如果代理模型未能从候选文档中复现目标答案,系统会自动修订文档。这一过程不需要访问受害者的模型参数或嵌入模型,属于黑盒攻击。

读者应记住,RAG系统的安全边界不仅在于模型本身,更在于其依赖的外部证据源。单份精心构造的叙事性文档足以在多种RAG配置下显著改变模型输出,这表明现有的基于检索位置或简单过滤的防御措施可能不足,需要更深层的事实一致性和来源溯源机制。

主要思路

ToxicRAG的攻击流程分为四个阶段:首先获取参考答案,然后选择目标答案,接着合成叙事元素(包括因果事件和权威引用),最后生成并精炼文档。在实验设置中,研究者在Natural Questions、HotpotQA和MS-MARCO三个数据集上各选取100个目标问题。受害者模型包括四个不同的LLM,检索器包括四种稠密检索模型。所有对比基线(PoisonedRAG-Blackbox, CorruptRAG-AS/AK, AuthChain)均被限制为每个目标仅注入一份文档,以公平比较。

评估指标主要关注攻击成功率(ASR),即生成答案与目标答案匹配的比例。此外,还分析了检索位置(retrieval position)和不同top-k上下文大小对攻击效果的影响。自验证环节使用一个代理LLM来检查候选文档是否能诱导目标答案,若失败则触发修订。实验还进行了消融研究,以评估RAG超参数(如top-k)和ToxicRAG内部超参数对最终ASR的影响。

关键结论

在采样语料库设置下,ToxicRAG在12种数据集-模型组合中取得了0.61至0.91的攻击成功率。具体而言,在Natural Questions上ASR为0.86-0.91,在HotpotQA上为0.74-0.80,在MS-MARCO上为0.61-0.63。ToxicRAG在所有组合中均匹配或超过最强基线,优势幅度在0到11个百分点之间。结果表明,叙事形式的投毒文档在评估的RAG配置下具有持续的影响力,且其效果受数据集和检索器类型的影响较大。

原文依据

评点

该研究揭示了RAG系统在部署中的关键安全漏洞:即使攻击者只有一次写入机会,也能通过精心设计的叙事文档操纵模型输出。这对依赖RAG进行事实查询的企业应用构成严重威胁,意味着现有的基于内容过滤或简单去重的防御可能失效。合规部署必须引入更严格的事实一致性检查和来源溯源机制,以防范此类隐蔽的知识投毒攻击。

阅读原文

id: arxiv:2609.11082