隐蔽还是显露:攻击成功率为何掩盖了真正要紧的注入
2026 年 8 月 31 日发表的一篇论文按用户可见性拆分间接提示注入的成功,并指出智能体自己的总结并不能充当审计日志。
这是什么?
2026 年 8 月 31 日(9 月 1 日修订),Yunseok Lee、Yunji Kim 与 Woojin Lee 发表了 “Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents”(arXiv 2608.30362),该论文被 EMNLP 2026 主会接收。这篇工作并未宣布一类新的漏洞。它主张:业界衡量间接提示注入的标准指标——攻击成功率(ASR,Attack Success Rate)——衡量的对象并不恰当,并在 AgentDojo 上以实验证明了这一差距。
其论点范围有限但很实用:ASR 统计的是被注入的操作是否被执行,却完全不涉及阅读智能体最终回复的用户是否会察觉。
工作原理
作者在检视成功注入的轨迹时,观察到两种截然不同的收尾方式。
第一种情况下,智能体执行了被注入的操作,随后回过头去完成用户最初的请求。最终回复看上去只是对一项普通任务的普通答复。第二种情况下,智能体执行完被注入的操作就此停止,于是最终回复描述的正是那个被注入的操作,用户因此有机会察觉。
作者将两者分别称为隐蔽(covert)成功与显露(overt)成功,并据此拆分常用指标:
ASR = CSR + OSR
CSR (Covert Success Rate) 攻击成功,最终回复中不留痕迹
OSR (Overt Success Rate) 攻击成功,用户可从回复中察觉
真正有意思的是其机制解释。在 ReAct 循环——绝大多数使用工具的智能体所遵循的”推理/行动”范式——中,最终回复本质上是对最近一次操作的总结。因此,一次注入最终呈现为隐蔽还是显露,很大程度上取决于智能体接下来做了什么,而非载荷是如何撰写的。终结整条轨迹的注入会变得可见;后面还接着若干正当工作的注入则被掩埋。
由这一观察出发,作者提出了 ICoA(Induced Covert Attack):与其设法提高注入本身的成功概率,不如构造被注入的文本,使智能体在执行之后重新回到用户的任务上。就原理而言,该载荷把被注入的指令包装成用户自己的追加请求,并在其后附加一个”归位”锚点,指示智能体完成后返回原始请求。在 AgentDojo 上针对四个目标模型的评测中,ICoA 取得了最高的 CSR,较最强基线提升 3.79 至 12.01 个百分点。
本文不复现任何载荷,理解该结论也无需载荷:这项技术是针对智能体工作次序的控制流技巧,而不是绕过防护栏的新方法。
为何重要
对于部署智能体的一方,有三点后果。
已公布的鲁棒性数字在错误的方向上偏乐观。 如果某模型公布的 ASR 为 4%,这个数字悄悄地把用户本来能发现的注入与用户根本无从发现的注入混在了一起。后一组才是运营上真正危险的部分:它比 ASR 小,但单次事件的破坏力大得多。ASR 相同的两个模型,CSR 可能相差悬殊。
智能体的总结不是日志。 现实中大量的智能体监督工作——人在回路的审阅、“批准前先看看它做了什么”——都建立在一个假设之上:自然语言回复如实反映了已执行的操作。这篇论文表明,打破该假设成本低廉;更糟的是,打破它是智能体表现良好的副作用。一个在注入之后尽职地返回用户任务的智能体,正是一个掩盖了该次注入的智能体。
攻击者有动机变得不那么贪心。 优化目标从”最大化注入被触发的概率”转为”最大化其不被察觉的概率”,两者对应的载荷并不相同。针对前者调校的防御,并不会自动覆盖后者。
防御
-
独立于模型输出记录操作。 关于智能体究竟做了什么,唯一可靠的记录是在模型之外捕获的工具调用轨迹。绝不要让最终回复充当审计线索。这正是 OWASP Agent Control Standard 提出的”可检视、可追溯、可插桩”要求——该标准已捐赠给 GenAI Security Project,并于 2026 年 9 月 1 日发布。
-
将轨迹与总结做差分。 一种低成本且与模型无关的检测方法:枚举实际调用过的工具,枚举最终回复中提及的操作,凡未出现在总结中的工具调用一律告警。隐蔽成功在构造上就是这两个集合之间的不一致。
-
在自有评测中报告 CSR,而不只是 ASR。 若您对自己的智能体栈做红队测试,请按用户可见性拆分结果。把隐蔽成功转化为显露成功的防御,即便 ASR 不变也是实打实的改进;而做了相反事情的”防御”是一次退步,却会被现有指标记为中性。
-
在编排层实施管控。 关于哪些工具可被调用、参数如何、哪些操作需要审批的运行时策略,并不依赖智能体如实叙述。ACS 所设想的、可在框架之间移植的声明式中间件挂钩是一条实现路径;能力范围收敛与操作白名单则是同一思路的手工版本。
-
对轨迹形态告警,而不只是对内容告警。 论文本身的发现就是次序携带信号:一个既非用户所请求、也未出现在回复中、且位于轨迹中段的操作,无论载荷内容如何,都是可检测的模式。
Status
| 项目 | 出处 | 日期 | 说明 |
|---|---|---|---|
| 隐蔽/显露论文(arXiv 2608.30362) | arXiv(cs.AI, cs.CL) | 2026-08-31(v2:2026-09-01) | EMNLP 2026 主会;在 AgentDojo 上评测 |
| ICoA 结果 | 同上 | 2026-08-31 | 四个目标模型上取得最高 CSR;较最强基线 +3.79 至 +12.01 个百分点 |
| Agent Control Standard (ACS) | OWASP GenAI Security Project | 2026-09-01 | 中间件挂钩 + 声明式运行时策略,可跨框架移植 |
| ACS 代码库 | GitHub(GenAI-Security-Project) | 2026-09 | 开放规范 |
正确的结论并不是间接提示注入变得更严重了,而是:人人引用的那个指标从未度量过”用户能否察觉”;一旦将其拆开,对事件响应最要紧的那部分,恰恰是此前无人追踪的部分。如果贵方的监督机制依赖于阅读智能体自称做过什么,那么贵方并没有监督机制。