系统:运行中
← 返回所有攻击
SUPPLY CHAIN MEDIUM NEW

审计 API 实际提供的模型——以及纯文本检测为何失效

2026 年的两篇论文表明,LLM 网关可能悄然替换或稀释您所付费的模型;而在工具调用端点上,审计方法所依赖的文本通道早已被丢弃。

2026-09-15 // 7 min affects: llm-api-gateways, llm-api-resellers, agentic-llm-apis, tool-calling-agents

这是什么?

您购买的是某个特定模型,拿到的却只是一个 HTTP 端点。两者之间没有任何环节能证明它们一致。

今年夏天发表的两篇论文从相反的角度切入这一缺口。IRIS(arXiv,2026 年 7 月 23 日投稿)仅依靠返回的文本来审计商业 LLM 网关。AgentProv(arXiv,2026 年 8 月 30 日投稿,已被 EMNLP 2026 接收)则认为:对于智能体 API,文本通道本身就是错误的观察位置,因此改为审计工具调用通道。

相关术语来自更早的形式化工作(arXiv,2025 年 4 月,此后有修订)。替换指整条流量的替代:每一次请求都被送往更廉价的后端——更小的检查点、量化版本,甚至完全不同的模型族。稀释则是按比例的:只有 ε 比例的请求被改道,这对供应方更省钱,也更难被发现。两者都可能源于配置错误、成本控制或虚假陈述,而从客户端看,它们并无分别。

攻击如何运作

两项审计都基于同一个观察:被提供的模型会留下能够穿过 API 边界的统计痕迹。

IRIS 利用了模型无法真正随机这一事实。当要求模型给出一个随机数字或随机字符串时,每个检查点都会返回稳定且具有模型特异性的偏置分布;将少量廉价探针上的这些偏置叠加起来,便构成一枚指纹。使该方法具备实用性的关键在于,它会自行确定预算:一次低成本的预实验拟合查询误差的衰减曲线,并在发出任何可疑流量之前就锁定查询数量。论文报告的结果为:在 Qwen3 同族梯度上验证后端的 AUROC 为 0.99;在合格模型对上检测 ε = 0.3 的稀释,平均检出功效 0.85,误报率 0.017;对已登记的替代模型,路由比例的估计误差在 0.04 以内。自适应分配使等预算下的命中率从 73% 提升到 87%。在针对某商业网关模型库开展的跨供应方实测审计中,IRIS 标记出 15 对同名模型供应方组合中的 14 对——这些差异被归因于真实存在的量化与算子实现差异,而非蓄意欺骗。

AgentProv 则从一个结构性问题出发。当模型调用工具时,现代服务栈会丢弃文本、仅暴露结构化动作,因此文本通道的审计方恰恰在最关键的流量上无从测量。更糟的是,供应方注入的系统提示会使文本分布产生足够大的偏移,从而让诚实的供应方显得可疑。AgentProv 转而对工具调用的类别分布取指纹——近期的智能体后训练已将工具使用策略写入权重——并通过 MMD 置换检验判定模型身份。论文报告在 630 组检查点配对上达到 100% 的检出率,同时在系统提示注入条件下将误报率控制在 7%,而其对比的两种文本通道基线方法分别为 67% 与 53%。

2025 年的形式化工作提供了悲观的另一面:纯软件验证在面对细微替换时查询开销巨大,而基于对数概率的方法会被生产环境中常见的推理非确定性击败。其提出的解决路径是硬件层面的——在可信执行环境(TEE)中进行可证明的推理。

为什么重要

您的安全保障证据是与具体模型绑定的。 红队结果、评测分数、拒答率、越狱抵抗力测量,全部产生于某一个确定的检查点。一旦实际提供的是量化或被替换的后端,您手中留下的只是文档,而非文档所描述的性质。

稀释在设计上就是可否认的。 一小部分行为异常的流量看起来与普通波动无异。而接入时的一次性核验——多数采购流程唯一真正执行的检查——恰恰是稀释能够绕过的那一项。

偏差不等于欺诈。 15 对中命中 14 对这一数字,正是该领域应有的审慎:提供相同权重的不同供应方,其量化级别与算子实现本就可能合法地存在差异。审计信号是提问的理由,而不是结论。

智能体部署是真正的盲区。 这与恶意代理路由不同——那里是敌对中间人主动攻击客户端。在这里,供应方完全可能出于善意,只是核验所需的证据已被服务栈丢弃。

防御建议

采购层面

  • 在合同中写明具体制品而非商业档位:模型、版本、量化方式、服务栈。要求任何变更均需通知,并保留审计权。
  • 询问是否提供可证明的推理(attested inference)。基于 TEE 的证明可以把统计论证替换为密码学保证。
  • 固定显式的模型标识符。避免 latest 之类的别名与静默自动切换路由,它们在设计上就会更换后端。

运行层面

  • 让一致性探测成为持续且有预算的动作,而不是接入时的一次性检查。先由预实验确定预算再执行,这样”未发现异常”才具有意义。
  • 对工具调用端点,请在动作通道上审计。文本通道的审计方所测量的信号,已被服务栈删除。
  • 在下结论之前,先排除供应方注入系统提示的影响。文本分布发生偏移是混淆因素,而不是判决。
  • 为每一次调用记录模型标识或指纹,使日后的质量或安全事件能够归因到具体后端。

保障层面

  • 定期将安全与能力评测的一个小子集重新跑在生产端点上,而不是参考部署上。一旦分数下降,应按供应链事件处理并相应升级。
  • 当供应方无法提供证明时,请显式估算残余风险:假设实际提供的模型可能弱于所宣称的模型,并检查您的控制措施在该假设下是否依然成立。

现状

项目内容
IRISarXiv 预印本,2026 年 7 月 23 日投稿
AgentProvarXiv 预印本,2026 年 8 月 30 日投稿;已被 EMNLP 2026 接收
问题形式化arXiv,2025 年 4 月(已修订)
已命名的失效模式替换(整条流量);稀释(ε 比例的请求)
IRIS 报告的检出能力同族 AUROC 0.99;ε = 0.3 时平均功效 0.85,误报率 0.017
IRIS 实测审计标记 15 对供应方组合中的 14 对,差异归因于量化与算子实现
AgentProv 报告的检出能力630 组检查点配对上 100%;系统提示注入下误报率 7%
文本通道基线(注入下误报率)67% 与 53%
厂商公告无——这是测量方法与审计设计问题,而非产品漏洞
代码IRIS 与 2025 年形式化工作均已公开

Sources