系统:运行中
← 返回所有攻击
DEFENSE MEDIUM NEW

Meta SecAlign:首个内置提示注入防御的开源模型

2026 年 7 月发布,这是首个在模型层面内置提示注入防御的开源权重大语言模型,其攻击成功率低于闭源同类模型,同时保持了实用性。

2026-07-18 // 6 min affects: llama-3.1-8b, llama-3.3-70b

这是什么?

Meta SecAlign 是一款开源权重的大语言模型,其针对提示注入的防御被内建到模型本身,而不是作为外部过滤器附加在外层。该模型于 2026 年 7 月 3 日发布在 arXiv 上(论文编号 2507.02735,同月还发布了 v2 修订版),作者来自 Meta(FAIR)和加州大学伯克利分校;模型权重与训练代码已发布在 GitHub 仓库 facebookresearch/Meta_SecAlign。作者将其描述为首个完全开源、开源权重、且在模型层面具备提示注入防御并达到商用级性能的大语言模型。

此次共发布两个模型:基于 Llama-3.1-8B-Instruct 的 Meta-SecAlign-8B,以及基于 Llama-3.3-70B-Instruct 的 Meta-SecAlign-70B。开放它们的既定目的,是让安全社区能够在一个真实模型上研究、攻击并改进针对注入的防御——而闭源商用模型及其专有防御机制往往使这类研究难以开展。

工作原理

提示注入之所以有效,是因为大语言模型在同一个无差别的词元流中同时看到指令和数据:来自被检索网页、工具输出或文档中的文本,都可能被模型当作要执行的命令。Meta SecAlign 通过训练阶段的方法来针对这一根本原因,而非在推理阶段打补丁。

该技术建立在同一脉络的两项早期工作之上。StruQ(结构化查询)通过专用分隔符将可信提示与不可信数据分开,使模型能够区分二者。SecAlign 是 2024 年的原始方法(发表于 ACM CCS 2025),在此之上加入了偏好优化:作者构建了一个偏好数据集,其中每个样本都将一段含注入的输入,与一个安全回应(遵循合法指令、忽略注入)和一个不安全回应(服从被注入的指令)配对。偏好优化训练模型强烈偏好安全行为。从概念上说:

输入:    [可信指令]  +  [不可信数据 …… “忽略以上内容并执行 X”]
优选输出:  回应可信指令,将“执行 X”视作无效数据
劣选输出:  执行 X

Meta SecAlign 将这一方案应用到基础模型规模。据论文所述,训练 70B 模型约进行 3 个轮次,在 8 块 NVIDIA H200 GPU 上耗时约 7 小时。其结果在 9 个实用性基准(包括 MMLU、MMLU-Pro、IFEval、BBH、GPQA Diamond、AlpacaEval2、SEP,以及智能体类的 AgentDojo 和 WASP 实用性赛道)和 7 个安全基准上进行了评估。核心论点是:Meta-SecAlign-70B 达到了业界领先的稳健性——攻击成功率往往低于 GPT-4o-mini、GPT-4o 以及 Gemini-Flash 2.0/2.5——同时保持与未加防御的基础模型相当的通用能力。特别是在 AgentDojo 上,论文指出该防御在降低攻击成功率的同时提升了任务实用性,而这正是大多数防御无法兼得的组合。

为什么重要

当前部署的大多数提示注入防御都是输入/输出过滤器、分类器或提示工程技巧(分隔符、“三明治”提醒)。它们有用但浅层:底层模型仍然倾向于服从它读到的任何指令,因此一个坚定的攻击者一旦绕过过滤器,就会到达一个没有防御的模型。早期 SecAlign 工作报告称,朴素的“三明治”防御仍留有 96% 的攻击成功率,StruQ 也在约 56% 的情况下被攻破,而基于偏好优化的对齐则将许多注入攻击压到 10% 以下。把防御搬进模型权重改变了攻击的经济账:对手现在必须击败模型习得的偏好,而不仅仅是它外面的一层包装。

开放性是值得关注的另一个原因。此前,最强的模型层面注入防御都存在于闭源产品中,外部研究者无法测量、探测或复现。一个公开可用的已防御模型,为红队、机器学习工程师和学术界提供了一个共享、可检视的基线——这正是推动该领域前进的攻防协同开发方式。这也意味着构建智能体的团队可以直接采用一个经过加固的模型,而无需信任厂商含糊其辞的说法。

需要如实指出的是:没有任何防御是完备的。经过训练以抵御注入的模型更稳健,但并非无懈可击,而在当今基准上测得的稳健性,可能在明天的自适应攻击面前被侵蚀。SecAlign 式的训练大幅降低了攻击成功率,但并未将其归零;它应当与下文的架构性控制结合使用,而不应被当作万灵药。

防御措施

  1. 对智能体类工作负载,优先选择内置注入防御的模型。 若要为使用工具的智能体选择基础模型,像 Meta SecAlign 这样经过公开评估的已防御模型,能提供一个可度量的稳健性基线,而非厂商无法验证的说法。
  2. 把信任边界放在架构中,而不仅仅放在模型里。 继续将可信指令与不可信数据分离,限制工具权限并遵循最小权限原则,使一次成功的注入影响范围有限。模型层面的防御降低了被攻破的概率,但并不能加以遏制。
  3. 叠加多层防御。 将加固后的模型与输入/输出过滤、结构化查询分隔符,以及对高影响操作的人工审批相结合。纵深防御依然适用。
  4. 针对自适应攻击重新测试。 基准数字反映的是已知攻击。运行你自己的红队测试套件(并随着新的注入技术发布而重复运行),而不要假设一项训练期防御能泛化到未来的每一种攻击。
  5. 既关注安全,也关注实用性。 联合优化模型的价值在于,过于激进的过滤会损害任务表现;请在你自己的工作负载上验证,已防御的模型是否仍保持你所需的行为。

状态

项目参考日期备注
Meta SecAlign 论文arXiv 2507.02735(v1)2026-07-03首个在模型层面具备提示注入防御的开源权重大语言模型
权重 + 训练代码facebookresearch/Meta_SecAlign(GitHub)2026-07Meta-SecAlign-8B(Llama-3.1-8B)、Meta-SecAlign-70B(Llama-3.3-70B)
原始 SecAlign 方法arXiv 2410.05451 / ACM CCS 20252024-10 → 2025基于偏好优化的防御;前身为 StruQ
BAIR 讲解(StruQ + SecAlign)伯克利人工智能研究博客2025-04-11关于结构化查询 + 偏好优化方法的背景介绍

值得记住的转变:针对提示注入的防御正从围绕一个顺从模型的外层包装,转向模型自身习得的偏好——并且首次以整个社区都能检视和压力测试的形式呈现。

Sources