系统:运行中
← 返回所有攻击
AGENTS MEDIUM NEW

智能体记忆投毒防御中的写入期盲区

2026 年 7 月的一个基准将持久化记忆攻击按三级难度分类——并表明拦得住露骨投毒的写入期过滤器,几乎挡不住分布式与潜伏型变体。

2026-07-20 // 6 min affects: llm-agents, agent-memory-systems, rag-pipelines

这是什么?

2026 年 7 月 16 日,南京大学的研究者在 arXiv 发布了一篇论文,提出了针对 LLM 智能体持久化记忆投毒的基准与分析框架。现代助手会保留外部长期记忆——偏好、事实、任务状态、交接备注——以便会话能够连续地恢复。而这种持久性本身就是一个长期存在的攻击面:通过普通渠道注入的内容可以在其原始回合之后继续存在,并在很久以后左右智能体的行为。本文的贡献不是一个新漏洞,而是一次度量。作者构建了一个包含 1,227 个人工校验案例的冻结集合,在十个模型家族上运行,并将记忆投毒归为三个结构层级。核心结论是:团队所依赖的低成本写入期防御能抓住最明显的一层,却在很大程度上漏掉了另外两层。

工作原理

论文把投毒组织成一条以注入危害之间距离来定义的难度阶梯。

L1——单条记录污染。 一条在写入时意图即可见的、明确有害的记录(例如声称某生产端点已迁移到攻击者控制的主机的记忆)。这正是准入处的合理性或安全检查本应拦截的情形。

L2——组合式污染。 载荷被拆分到若干条各自看似合理、随时间注入的记录中。每条单独看都无害;危害只有在稍后的任务中这些片段被一同检索并组合时才显现。逐条准入过滤器在任何单个片段中都看不出异常。

L3——由上下文触发的潜伏污染。 一条在正常使用下惰性的记录,只有当稍后出现特定的自然上下文时才激活恶意行为(一条在某个周期性任务中被触发的「休眠」指令)。在准入时它读起来是中性的。

威胁模型被刻意设定得很弱:攻击者既无法访问权重、系统提示,也无法访问记忆数据库内部接口,只能通过标准渠道写入——用户输入、工具输出或智能体间消息。为了解释防御为何在各层级表现不同,作者引入了机制影响分解(Mechanistic Influence Decomposition,MID),这是一种反事实方法,通过移除记忆项并度量输出变化,分离出单记录影响、成对交互与触发条件激活,分别对应 L1、L2、L3 的特征。

为什么重要

在无防御情况下,十个模型在干净任务上都保持高准确率(平均约 94%),却极易被污染,行为污染率平均为 62.5%,各家族在约 54% 到 67% 之间。污染随阶梯上升:按层级拆分,无防御下的比率约为 45%(L1)、52%(L2)和 77%(L3)。由外部中介的写入——工具返回与智能体间消息——比直接的用户输入更常污染记忆,而扁平「块」式存储比拆解后的事实库更暴露。

真正的痛点在防御一侧。写入期一致性检查把 L1 污染降到 5% 以下——却让 L2 停在约 23%、L3 停在约 28%。换言之,能压制露骨情形的过滤器,对分布式与潜伏情形几乎无动于衷。最好的结果来自在整条管线上叠加防御(一个集成方案总体达到约 11%),但残余污染依然存在,集中在 L2 和 L3。MID 给出了结构性原因:准入过滤器只能就记录写入那一刻做出判断;被推迟的危害——稍后由无害片段拼装,或被未来上下文解锁——落入了任何写入期检查都看不到的盲区。

防御

在实践中,应停止把写入期准入当作主要防线,也停止用单一的攻击成功率来评价记忆卫生。写入期过滤仍值得保留,作为对 L1 的底线,但要与检索期和行为期控制相配合:按来源的出处与独立性对检索到的记忆进行加权或门控,使得来自同一不可信来源、被一同检索的片段无法悄然拼成载荷;并采用对冲突敏感的推理,在行动前标记出与可信状态相矛盾的检索记忆。把工具输出与智能体间消息视为比直接用户输入风险更高的记忆写入,并在可行时优先采用拆解式记忆表示,而非逐字的块式存储。

由于 L2 与 L3 的有害行为只在检索或触发时出现,监控也必须下移到管线下游:记录哪些记忆驱动了有后果的动作,并准备事后审计,能够把不良输出归因到相应记录——这是与投毒记忆取证相关的并行工作所探索的方向。用组合式与潜伏型案例对记忆管线做红队测试,而不仅是孤立的露骨记录,并逐阶段评估防御——准入、检索、行为——而非报告一个掩盖管线真实失效位置的聚合分数。这些控制与 OWASP 关于智能体化 LLM 应用记忆与数据投毒的指南一致。

状态

项目详情
贡献持久化记忆投毒的基准 + 机制分析
分类法L1 单记录 · L2 组合式 · L3 上下文触发潜伏
基准1,227 个人工校验案例 · 10 个模型家族 · 3 种记忆底座
无防御污染平均约 62.5%(L1 约 45% · L2 约 52% · L3 约 77%)
写入期一致性检查L1 <5% · L2 约 23% · L3 约 28%(L2/L3 盲区)
最佳防御(集成)总体约 11%,L2/L3 存在残余污染

关键日期:基准论文于 2026 年 7 月 16 日发布于 arXiv。

Sources