防护措施的评测分数并不能说明您的部署是否安全
2026 年 9 月 1 日的一篇 arXiv 审视论文指出:防护指标是非对称证据——一次成功攻击即可证明残余风险,而任何拒答率都无法证明其不存在。
这是什么?
2026 年 9 月 1 日,Pingyu Wu、Weiming Zhang 与 Nenghai Yu 在 arXiv 发布了 The Safeguard Worked. Is the LLM System Safer?。这不是一篇攻击论文,而是对防护措施研究如何报告自身结果的一次审视。对任何采购、部署或签字批准 LLM 防护措施的人来说,其结论都不太舒服。
生产环境中的防护措施通常用三个数字衡量:拒答率、攻击成功率(ASR)与策略违规率。论文认为,这些数字回答的是一个局部问题——该控制措施在被测试的那些请求上表现如何;而部署方需要的是另一个问题的答案:面对一个持续调整手法、或另寻入口的攻击者,该服务还能为有害任务提供多少帮助。作者按照第二个判据重新解读已发表的结果,使不同防护家族(过滤、安全微调、遗忘、分类器门控)的论断能够在统一的部署级标准下相互比较。
工作原理
该结论关乎证据,而非某个 payload。论文指出,证据要求是高度非对称的:
论断 确立它需要什么
--------------------------- ------------------------------------------------
"该部署中仍存在有害帮助。" 一次能够从已部署服务中获得有害帮助的攻击。
单独即可成立。作者指出,此类攻击在编码语料中
反复出现。
"几乎不再存在有害帮助。" 无法仅凭防护措施自身的数字得出。还需要关于
防护措施完成其局部职能之后、周边系统仍然允许
什么的独立证据。
这种非对称性正是安全性证明的常见形态——证明”存在”成本低廉,证明”不存在”代价高昂——但当某个防护厂商或某篇论文宣布”ASR 从 62% 降至 4%“时,它却被习惯性地忽略。这个 4% 描述的是被测试的请求分布,它没有谈及自适应攻击者、替代入口路径,也没有谈及过滤器背后的动作层。
审视的第二个结果更为尖锐。在作者做深度编码的论断中,关于系统级残余能力的证据仅在极小一部分案例中得到支撑或推导,且其中恰好只有一条论断真正给出了其限定范围内的残余上界。换句话说:这个领域在衡量控制措施,几乎从不衡量系统。因此,更好的局部分数本身并不构成关于部署的更强论断。
2026 年 9 月的另一篇论文从组合性的角度指向同一缺口。Capability-Gated Language Models: Security Composes, Utility Does Not(2026 年 8 月 31 日)形式化了同一套权重内按主体划分的访问控制,发现限制在安全一侧可以可预测地组合,在效用一侧却不能:单独看无害的限制配置组合起来可能造成记忆保持与流畅度的损伤,且不存在任何组合性上界。叠加防护措施并非免费操作,而其代价恰恰落在最少被测量的地方。
为什么重要
这重新界定了三场实务对话。
采购。 厂商标榜的 ASR 降幅是关于其评测集的论断,而非关于您技术栈的论断。按照论文的判据,这个数字无法支撑”我们的部署是安全的”,它至多只是没有反驳该说法。更应当追问的是:防护措施触发之后,系统还允许什么——哪些工具仍可调用,哪些外发路径仍然敞开,哪些数据仍在可及范围内。
研究激励。 如果可发表的单位是局部分数,投入就会流向抬高局部分数。作者明确表示:防护措施研究不能止步于此——一项改进必须以它是否让已部署系统更安全来衡量。从不建模周边系统的基准,将持续奖励那些无法迁移的工作。
运营。 OWASP GenAI Security Project 2026 年智能体 AI 安全与治理状况报告(2026 年 6 月的综述)记录了后果:提示注入对应智能体 Top 10 中的六个类别,而真实事件集中出现在模型被迷惑之后系统仍然允许的事情上——白名单命令夹带 payload、沙箱边界被智能体输出重新定义、权限模型在攻击者触发与操作失误时同样失效。这些都不会体现在拒答率里。
防御建议
正确的做法不是放弃防护措施,而是停止把它们的分数当作部署证据,转而衡量真正约束您风险的东西。
-
衡量残余能力,而非过滤器准确率。 在假定防护措施按设计正常工作的前提下,界定一个成功的攻击者仍能触及什么。这个数字——而非 ASR——才是您的风险陈述。
-
要求厂商给出限定范围的残余上界。 询问评测覆盖了哪类攻击群体、自适应攻击者是否在范围内、厂商对周边系统作出何种声明。“无界”是可接受的答案;把未加限定的 ASR 当作安全论断则不是。
-
按”绕过可存活”来设计架构。 外发白名单、短时且权限收窄的凭据、隔离的运行时、对不可逆操作的人工审批——无论分类器是否触发,这些都能降低残余能力。可参阅致命三要素与智能体二选三规则。
-
对系统做红队,而非对分类器。 止步于”过滤器拦住了”的测试衡量的是控制措施。请把测试继续下去:还有哪条路径能达到同样的能力?
-
为组合成本留出预算。 依据能力门控的结论,叠加的限制在安全侧可组合,在效用侧不可。叠加防御时,请把能力回退作为一等指标跟踪,否则您会在无声中为一份无法证明的保护买单。
-
在上游分离数据与指令。 局部过滤是覆盖在架构问题之上的一层:模型将系统提示、用户请求与检索内容读作同一个 token 流。输出过滤与信息流控制处理的是该问题的不同部分,应当分别评估。
Status
| 项目 | 参考 | 日期 | 备注 |
|---|---|---|---|
| The Safeguard Worked. Is the LLM System Safer? | arXiv:2609.00519 | 2026-09-01 | 以部署级判据审视防护措施研究的报告方式 |
| Capability-Gated Language Models | arXiv:2609.00445 | 2026-08-31 | 安全可组合;效用不存在组合性上界 |
| OWASP State of Agentic AI Security and Governance v2.01 | Help Net Security 综述 | 2026-06-11 | 提示注入对应智能体 Top 10 中的 6 个类别 |
本文未披露任何漏洞,也未指向任何具体产品。这里的启示是方法论层面的,并且今天就可付诸实践:防护措施的分数衡量的是一个控制措施,而您的风险存在于它周围的系统之中。在一项论断尚未附带关于该系统仍然允许什么的证据之前,更低的攻击成功率只是更好的局部结果,仅此而已。