广告位图片可劫持网页智能体的下一步操作
2026 年 6 月的一篇论文表明,仅控制一个合法广告位或赞助卡片(而非整个页面)的攻击者,就能放入一张看似无害的图片,引导多模态网页智能体的下一次点击。
这是什么?
多模态网页智能体——那种通过查看渲染后的截图来决定下一步点击、从而操作浏览器的智能体——存在一个信任问题,而它并不能干净地对应到网页世界惯常的边界上。山东大学一支团队的一篇 2026 年 6 月论文描述了作者称为 MIRAGE 的框架,把这一点讲得很清楚:危险并不总是来自恶意的网站,它可能只是你信任的网站上的一块第三方区域。
这个威胁模型刻意保持”低调”,而这恰恰使它显得真实。攻击者并非页面所有者,无法改写页面。他只是一个普通的、无特权的第三方——一个商家、一个广告主——合法地控制着一块有界的区域:一个广告位、一张赞助卡片、一个推荐小组件。就在这个方框内,且仅在这个方框内,他放入一张图片。论文报告称,这样一张被制作得毫不起眼的图片,可以劫持多模态智能体的下一步操作,并在两个知名智能体框架 SeeAct 与 Open-Claw 上得到了验证。
工作原理
由截图驱动的智能体把渲染后的页面当作它的”地面真值”:像素就是它据以推理的世界。它并不会天然地区分”用户所询问的内容”和”某广告主付费放在角落里的内容”。每一个像素都带着同等的隐含权威。这正是 MIRAGE 所利用的接缝——一种视觉形式的间接提示注入问题:不可信内容之所以变成指令,是因为模型无法区分指令与数据。
有两点性质使这一变体格外值得注意。第一是”受限性”:对抗信号严格存在于攻击者确实获准控制的区域之内,因此周围可信页面的任何部分都不会被改动。第二是”隐蔽性”。这项技术不是贴上”忽略你的任务并点这里”这类显眼文字——那种人工审阅者和简单检测器都能抓到的痕迹——而是借助扩散模型合成一张看似无害的图片,再用稀疏、低可见度的残差扰动加以打磨。在人看来,它就像一则普通的广告素材;对智能体而言,它却像一记推力,把它推向攻击者选定的下一步操作。
可信页面(example.com)
┌───────────────────────────────────────────┐
│ 用户真正想看的文章 │
│ │
│ ┌───────────────┐ <-- 攻击者仅拥有 │
│ │ 广告位 │ 这一个方框 │
│ │ (看似 │ │
│ │ 无害的图片) │ 智能体把整张截图 │
│ │ │ "看"成同一个字段 │
│ └───────────────┘ │
│ │
└───────────────────────────────────────────┘
│
▼ 操作劫持:点击 / 跳转 / 提交
我们描述的是机制,而非配方。这里不包含任何有效载荷、优化代码或复现步骤;重点是这一类暴露面以及如何将其封堵。
为什么重要
网页从来都不是单一的信任域,而智能体继承了这种混乱。现代页面惯常把自有内容与第三方广告位、赞助位、商家提供的商品图和推荐小组件拼接在一起。人类读者大多会忽略广告;截图智能体却做不到——它把广告视为它据以推理的同一个视觉字段的一部分,而这些有界区域中的任何一个,如今都可能从单纯的装饰变成一个控制面。
这降低了攻击一个智能体所需的门槛。你不再需要攻陷一个网站,也不用赢下一场 SEO 之争;在一个可信页面上买下一个位置也许就够了。而且由于注入的图片被设计得看似合法,那些搜寻明显视觉痕迹或显眼注入文字的防御手段面对它时处境不利。就智能体而言,劫持下一步操作绝非表面文章:这个”操作”可能是点开一个恶意链接、加购一件商品、跳转到凭证页面,或提交一个表单——当智能体同时握有私有数据和一条外发通道时,这些正是致命三要素的成分。
防御
没有单一开关能解决这个问题。有效的做法把区域来源与操作权限当作头等对象,并可与现有的截图注入检测研究(如 SnapGuard 和 WebSentinel)相结合。
-
把权限绑定到来源,而非像素。 追踪渲染页面中哪些部分来自第三方区域(广告位、赞助卡片、嵌入式组件),并拒绝让这些区域的内容影响智能体的计划。来自广告框的像素绝不应携带指令权威。
-
把感知与指令分开。 让”页面所显示的内容”与”用户所要求的内容”严格区分。把智能体锚定在用户的任务上,并把页面上的一切视觉内容——尤其是第三方区域——当作需要被概括的不可信数据,而绝非需要遵从的命令。
-
决策时优先采用语义视图而非原始截图。 在可能的情况下,从 DOM 结构、带标签的元素和白名单目标出发来选择操作,而不是依据不可信区域的原始渲染图像。在智能体对第三方素材进行推理之前,先将其隔离或清洗。
-
对有后果的操作加以门控。 在任何不可逆或外发步骤(跳出本域、购买、提交表单、数据外泄)之前,要求确认并施行最小权限。被劫持的建议尚可承受;被劫持的交易则不然。
-
检测并监控,但不要过度信任痕迹检测器。 运行截图注入检测器,并记录智能体的操作轨迹,使被劫持的下一步操作事后可见——同时记住,一张刻意做得无害的图片,本就是为了绕过针对显眼痕迹的检查而设计的。
状态
| 项目 | 参考 | 日期 | 说明 |
|---|---|---|---|
| MIRAGE 框架发布 | arXiv:2606.20717 | 2026-06 | 局限于合法第三方区域内的视觉间接注入 |
| 威胁模型 | 同上 | 2026-06 | 无特权第三方(商家/广告主)仅控制一个广告位 / 赞助卡片 / 组件 |
| 受评估的智能体 | 同上 | 2026-06 | 在 SeeAct 与 Open-Claw 多模态网页智能体框架上得到验证 |
| 截图检测背景 | SnapGuard / WebSentinel | 2026 | 面向截图式网页智能体的检测与定位研究 |
| 生态背景 | TNW 综述 | 2026-07-20 | 属于 2026 年 7 月一波更广泛的智能体信任类发现的一部分 |
真正重要的重新定义是:对网页智能体而言,信任的单位不是地址栏里的域名——而是渲染页面据以拼装而成的每一块有界区域。把第三方区域当作不可信输入,让操作权限远离原始像素,并对一切无法撤销的操作加以确认。