系统:运行中
← 返回所有攻击
DEFENSE MEDIUM NEW

DualView:堵住个人 AI 代理中「存储型」提示注入的缺口

2026 年 7 月的一篇 arXiv 论文指出,符号替换类防御会漏掉代理写入磁盘再读回的注入,并提出在整个环境(而非仅上下文)中追踪不可信数据。

2026-07-20 // 5 min affects: llm-agents, personal-ai-agents, dual-llm-defenses, agent-file-systems

这是什么?

个人 AI 代理——那些运行在你自己机器上、自动完成网页搜索、邮件与文件管理的代理——面前是一片庞大而敏感的攻击面:网络、文件系统与 shell。正是这种访问权限使间接提示注入(IPI)变得危险,因为代理读取的任何网页、邮件或文档都可能携带指令,而代理随后会去执行。2026 年 7 月的一篇 arXiv 论文 DualView: Preventing Indirect Prompt Injection in Personal AI Agents (2607.03821)(作者 Juhee Kim、Woohyuk Choi、Taehyun Kang、Youngmin Kim、Byoungyoung Lee)指出了主流防御模式之一中的一处盲区,并提出了修补方案。

所讨论的模式是 Dual LLM(双 LLM)设计,由 Simon Willison 于 2023 年 4 月提出,后由 CaMeL(Defeating Prompt Injections by Design,arXiv 2503.18813) 等系统加以形式化。其思路是让不可信内容远离持有工具的模型:一个特权组件负责规划与行动,而不可信数据被替换为不透明的符号,代理可以传递却无法真正读取。DualView 的贡献在于指出:这套记账只到代理上下文的边缘为止——而攻击者可以绕过这条边缘。

工作原理

论文命名的这处缺口是存储型 IPI(stored IPI)。双 LLM 防御只在数据停留于代理工作上下文内时,才追踪其不可信属性。一旦代理把内容写到外部——将网页片段存入文件、追加到笔记、把某个值放入 shell 变量——这条来源标签便丢失了。当代理随后再次读回同一内容时,它会以全新数据的身份返回,被当作可信数据而非受保护的符号。如果攻击者的指令藏身其中,它就此完成了「洗白」:仅凭在文件系统里走了一个来回,就从「不可信」变成了「可信」。

在概念层面的流程如下:

[ 网页 / 邮件携带一段形似指令的字符串 ]
        │  读入上下文  →  标记为不可信(显示为符号)

[ 代理把该值写入文件 / 笔记 / shell 变量 ]
        │  来源标签不会随数据离开上下文

[ 稍后,代理再次读回该文件 ]
        │  数据无标签返回  →  被当作可信

[ 代理此时「看见」被植入的指令,并可能执行 ]

DualView 的答案是把不可信数据的追踪从上下文窗口延伸到环境本身——文件系统、shell、网络与其他代理。每个通道都被赋予两种视图。在 AgentView 中,即便代理已把数据写出再读回,仍将不可信内容视为符号,从而堵住存储型 IPI 的通路。在 HumanView 中,原始数据得以保留,使人类用户与普通工具仍能看到真实值并正常工作。换言之,标签被做成随数据流动而持久存在,而不是在模型上下文边界处蒸发。

为什么重要

存储型 IPI 之所以重要,是因为它击败了许多团队如今视为坚实基线的一种防御。双 LLM 与基于能力的方法之所以有吸引力,恰恰在于它们承诺提供结构性保护而非尽力而为的过滤——例如 CaMeL 报告在 AgentDojo 上以可证明的抗注入安全性解决了 77% 的任务,而无防御代理为 84%。但一种假设不可信数据可被限制在上下文内的防御,隐含着一条边界,而一个整天读写文件的个人代理会不断跨越这条边界。攻击者无需新奇的漏洞利用,只需把文本放进代理会保存并重新打开的东西里——对于文件管理助手而言,这正属于它的日常工作。残余风险在于持久性:一条在磁盘上存活的注入,会在代理每次重访该文件时重新「上膛」。

防御

论文给出的教训极为实用:把来源当作数据的属性,而非对话中某个时刻的属性。如果你依赖双 LLM 或符号替换方案,请检查其不可信数据追踪是否会随内容写入与读取而贯穿文件系统、shell 与网络;若不会,就应假定存储型 IPI 在你的暴露范围之内。一种让「不可信」标签随值流动而始终附着的双视图方法,是堵住该缺口的途径之一;无论具体实现如何,这一通用原则都适用。

除这一具体修补之外,围绕设计模式的既有文献仍然成立。让能够行动的组件与不可信内容保持分离,正如 Willison 及其合作者的模式目录 及其 配套论文(arXiv 2506.08837) 所述。对代理的文件、shell 与网络触及范围施加最小权限,使被洗白的指令可利用的手段更少。评估注入防御时,请用写入磁盘再读回的载荷去测试它——而不仅是单轮的上下文内注入——从而在部署之前、而非之后,就把存储型 IPI 纳入威胁模型。

状态

项目参考日期备注
研究论文DualView: Preventing Indirect Prompt Injection in Personal AI Agents,arXiv 2607.038212026 年 7 月定义「存储型 IPI」;AgentView/HumanView 双视图追踪
既有防御Defeating Prompt Injections by Design(CaMeL),arXiv 2503.188132025 年 3 月基于能力的双 LLM;AgentDojo 77% 任务具可证明安全性
设计脉络Dual LLM 模式(Simon Willison)2023 年 4 月特权行动者 + 隔离读取者;符号化响应
模式目录Design Patterns for Securing LLM Agents against Prompt Injections,arXiv 2506.088372025 年 6 月面向代理的更广防御模式集

Sources