MMPIBench:智能体尝试多模态注入的次数是得手次数的十倍
2026 年 9 月 8 日发布的加州州立理工大学波莫纳分校基准测试,在六个智能体框架上运行了 720 次多模态攻击。12.8% 被尝试,约 1% 得手——而音频通道的得手率高达 49%。
这是什么?
2026 年 9 月 8 日,来自加州州立理工大学波莫纳分校的 Viet K. Nguyen 与 Mohammad I. Husain 在 arXiv 上发布了 An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks(2609.09404,cs.CR/cs.AI)。论文提出 MMPIBench:一套测试装置,用同一组攻击载荷、同一套模拟工具、同一份系统提示词,在六个智能体框架与五个基础模型上运行,并记录每条注入指令走到了哪一步,而不只是它是否最终得手。
核心发现是一个落差。在 720 次运行中,攻击的得手率约为 1%,但被尝试的比例达到 12.8%——大约每十次尝试才有一次得手。作者明确界定了研究性质:「We do not propose a defense; MMPIBench is a measurement tool.」
工作原理
该基准测试交叉了四个维度:六个框架(LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Semantic Kernel、LlamaIndex Workflows)、五个模型(Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro、Grok 4.3、Llama 4 Maverick)、六种视觉载体,以及四类攻击目标——工具滥用、数据外泄、记忆投毒与智能体间传播。工具均为模拟实现,因此「得手」意味着智能体发出了危险调用,而非真实系统受损。
论文的贡献在于其阶段化测量。每次运行都按其到达的最远阶段标注:
Stage Meaning Share of 720 runs
---------------- --------------------------------------------- -----------------
None Payload never perceived 32.9%
Perception Payload read, flagged suspicious, agent stopped 23.6%
Planning Payload read and reasoned about, not acted on 42.1%
Tool invocation Malicious tool actually called 0.3%
Execution Deterministic judge confirms objective met 1.11%
由此可得出三点结论。
模型的影响远大于框架。 各模型的尝试率从 0.0%(Claude Opus 4.8,其 144 次运行中另有 59.7% 为明确拒绝)到 23.6%(Grok 4.3 与 Llama 4 Maverick 各自)。各框架的尝试率则集中得多,介于 10.0% 与 21.7% 之间——论文还指出该对比中存在两项它无法分离的混杂因素。
载体之间差异极大。 渲染进图像的文字(OCR)在其运行中被尝试的比例为 27.5%,并占据了 8 次得手中的 7 次。EXIF 元数据与二维码的尝试率为 0.0%:在约 88% 的相关运行中,载荷甚至从未进入感知阶段,因为模型在没有显式解码工具的情况下,既不读取 EXIF 字段,也不从像素中解码二维码。
拦截发生在规划阶段,而非某道屏障。 多数运行终止于占比 42.1% 的规划区间:模型读取了指令,但选择不继续执行。217 次拒绝中仅有 170 次在感知阶段被拦下,其余虽带有拒绝措辞,却仍进入了规划阶段。
为什么重要
约 1% 的得手率是论文中最不值得关注的数字,作者本人也这样认为。阻止其余 11.8% 的并非任何架构机制,而是模型本身。正如第 VIII-A 节所言:「a behavioral guardrail holds only as long as the model keeps making that judgment.」
音频部分的扩展让这一点变得具体。五个模型中仅有两个原生支持音频分词,六个框架中也仅有三个真正传递音频——CrewAI 接受音频却从不附加,AutoGen 根本没有音频消息类型。但只要信号抵达,攻击的得手率就达到 49%(72 个单元中的 35 个),在 gpt-audio 上更高达 75%。一个丢弃某种模态的框架并没有在保护你,它只是没有把它传下去;而一旦该功能上线,这道缺口随即闭合。
作为对照,VPI-Bench(新加坡国立大学,2025 年 6 月)在真实平台上报告的欺骗成功率,对计算机操作型智能体最高达 51%,对浏览器型智能体则达 100%。两组数字并不矛盾:它们衡量的是不同的威胁模型、任务设定与提示词措辞。这正是单一「成功率」难以在论文之间迁移的原因。
防御
该论文未评估任何缓解措施。 以下条目区分了论文的建议与通行实践。
来自论文:
- 同时报告尝试率与识别率,而非只报告得手率。 得手率「只衡量当前这一代模型恰好拒绝的频率」。
- 区分「拒绝」与「疏忽」。 「Only recognition is a guardrail. A model that overlooks a payload offers no assurance that it will keep overlooking it as carriers improve.」
- 关注规划区间。 读取了载荷却默默忽略的运行,提供的是「比拒绝更弱的保证」。
- 把缺失的模态视为意外,而非防线。 三道闸门模型——模型须能对该通道分词、框架须传递它、模型随后须拒绝——意味着攻击需要三道闸门同时敞开。其中两道属于产品决策,而非安全控制。
- 将安全训练与评估扩展到感知通道。 音频目前比视觉更窄,但防护也薄弱得多。
通行实践,非出自论文:
- 收紧行动面,而非输入面。 此次测试中没有任何过滤器拦下任何东西。所有得手案例都是工具滥用:无论指令来自何处,破坏性调用与外发调用都应要求确认。
- 将载体与动作一并记录。 在任何敏感调用旁保留对应的图像或音频,以便事后审查追溯载体。
- 每次版本更新后重测。 作者称其结果是「特定版本的快照,而非系统的持久属性」。
状态
| 项目 | 参考 | 日期 | 备注 |
|---|---|---|---|
| 论文 | arXiv:2609.09404 v1 | 2026-09-08 | cs.CR / cs.AI,CC BY-NC-ND 4.0 |
| 作者 | Nguyen 与 Husain | — | 加州州立理工大学波莫纳分校 |
| 规模 | 720 次图像运行 + 72 个音频单元 | — | 6 框架 × 5 模型 × 6 载体 × 4 目标 |
| 尝试率 / 得手率 | 12.8% / 约 1.11% | — | 95% Wilson 区间:10.5–15.4% 与 0.6–2.2% |
| 音频得手率 | 49% 的单元;gpt-audio 为 75% | — | 2 个模型支持音频输入,6 个框架中 3 个传递音频 |
| 基准发布 | 承诺随论文发表 | — | 预印本中未给出仓库地址 |
| 真实世界利用 | 未见报告 | — | 模拟工具,受控研究环境 |
真正令人不安的,并不是一百次攻击中有一次成功。而是另外十一次都走得足够远,以至于在一条被渲染出来的指令与一次工具调用之间,唯一的阻隔只剩模型自身的判断——而在那条最少有模型被训练去行使这种判断的通道上,一半的攻击走到了终点。