系统:运行中
← 返回所有攻击
RESEARCH MEDIUM NEW

多态女巫投毒绕过 RAG 去重过滤器

2026 年 7 月的一个基准测试表明,协同且用词多样的段落能绕过拦截简单 RAG 投毒的去重过滤器——而攻击成功率指标掩盖了大部分实际危害。

2026-07-20 // 6 min affects: rag-systems, retrieval-augmented-generation, llm-agents

这是什么?

2026 年 7 月,研究人员在 arXiv 上发布了一个针对协同检索投毒下的有据问答(grounded QA)的基准测试与评估框架——这类攻击会把恶意文档植入检索增强生成(RAG)系统所读取的语料库中。其核心贡献是提出了一个具名的攻击类别——多态女巫投毒(polymorphic Sybil poisoning),以及一项测量结论:多数团队用来评估 RAG 鲁棒性的指标,系统性地低估了被投毒系统实际表现的糟糕程度。该工作延续了 2026 年不断增长的 RAG 语料库投毒研究,但它是第一个专门厘清共谋段落之间的表层多样性对攻击与防御各自意味着什么的研究。

工作原理

经典的 RAG 投毒会植入一个恶意段落——或若干近乎相同的副本——由检索器针对目标问题召回,从而把阅读模型推向攻击者选定的答案。一种常见且廉价的防御是词面近重复过滤:若召回的多个段落在文本上几乎相同,就丢弃重复项。这个过滤器能完全拦截单态(monomorphic)情形,即攻击者重复使用同一段文字。

女巫攻击(Sybil attack)则可以绕过它。攻击者不再重复一个段落,而是播撒许多用词各异但都支持同一目标论断的段落。每一个看起来都像独立来源;合在一起便构成虚假共识。由于任意两段都不近似重复,那个能拦下复制粘贴版本的去重过滤器便无从下手。研究者将这种表层变化称为多态性(polymorphism),并把单态/多态这一维度视为关键变量。

为了干净地度量该效应,他们把通常混在一起的两件事分开:毒是否被检索到,以及一旦毒进入上下文,阅读器如何化解冲突。一个「强制暴露」(Forced Exposure)协议固定住被检索的上下文,使评估能够把阅读器一侧的行为与检索噪声隔离开。随后每条输出被归入四个互斥类别——gold(正确答案)、hijack(攻击者的答案)、abstention(模型拒绝作答)与 drift(其他错误答案)——并用成对的「干净→投毒」转移矩阵,追踪引入毒后每个问题的走向。

为何重要

有两点结论尤为突出。第一,多态是有回报的。在一次受控消融实验中,单态副本仅有 4.0% 的情况成功造成 hijack,而给同一恶意论断赋予多样的表层形式后,该比例回升到 22.8%——提升了 +18.8 个百分点,即在标准攻击成功率(ASR)指标可见的攻击通道上,放大了约 5.7 倍。能压制天真攻击的防御,几乎无法削弱其协同版本。

第二,单看 ASR 是错误的尺子。在攻击之下,「abstention」与「drift」两类合计占据全部输出量的 47% 至 66%——这些失败从不表现为 hijack。两个 ASR 几乎相同的阅读模型,在 abstention 上相差 16.5 个百分点,在 drift 上相差 17.2 个百分点。换言之,按主要数字看似同样鲁棒的两个系统,其失败方式可能截然不同;只优化低 ASR 的团队,对毒真正给其流水线带来的大部分影响是盲目的。为便于复现,作者发布了一个冻结的基准测试,含 3,145 个问题与 2,982 个保留的女巫组,覆盖从 7B 到 120B 参数的五个阅读模型、两个检索器以及两种交叉验证设置。

防御

实用的教训是:面对协同投毒,近重复过滤与只看 ASR 的评估会带来虚假的安全感。把词面去重当作底线而非防御:加入能识别措辞各异却推动同一论断的多个段落的语义级聚类,并按来源的出处与独立性、而非按数量来为召回证据加权,使一群伪造的「来源」无法制造共识。在阅读器一侧,优先采用能显现来源分歧、并在支撑薄弱或相互矛盾时允许弃答的冲突感知提示,同时要求引用锚定,使答案必须指向可识别的证据。

在评估方面,不要再用单一数字来衡量鲁棒性。在追踪 hijack 的同时追踪 abstention 与 drift,用成对的「干净→投毒」转移来观察每个问题的移动,并在部署前用多态变体——而不仅是重复字符串——对检索流水线进行红队测试。已发布的基准测试为防御方提供了现成手段。最后,加固摄取链路:监控进入语料库的内容,对来源施加信任分级,并限制任一未经核验的来源对某个答案背后证据的贡献上限。这些控制与 OWASP 关于 LLM 应用数据与知识库投毒的建议相吻合。

状态

项目详情
贡献RAG 投毒的失败模式基准 + 评估框架
攻击类别多态女巫投毒(协同、用词多样的段落)
输出分类Gold · hijack · abstention · drift
关键结果多态使可见 hijack 放大约 5.7×(4.0% → 22.8%)
隐藏失败攻击下 abstention + drift 占输出的 47–66%
基准3,145 个问题 · 2,982 个女巫组 · 五个阅读模型(7B–120B)· 两个检索器

关键日期:基准论文于 2026 年 7 月发布于 arXiv。

Sources