système : OPÉRATIONNEL
← retour à tous les hacks
DEFENSE MEDIUM NEW

Le score d'un garde-fou n'est pas une affirmation sur votre déploiement

Un audit arXiv du 1er septembre 2026 montre que les métriques de garde-fous sont une preuve asymétrique : une attaque qui passe suffit, aucun taux de refus ne prouve l'inverse.

2026-09-13 // 7 min

De quoi s’agit-il ?

Le 1er septembre 2026, Pingyu Wu, Weiming Zhang et Nenghai Yu ont publié sur arXiv The Safeguard Worked. Is the LLM System Safer?. Ce n’est pas un papier d’attaque. C’est un audit de la façon dont la littérature sur les garde-fous rend compte de ses propres résultats, et il aboutit à une conclusion inconfortable pour quiconque achète, déploie ou valide un garde-fou LLM.

Les garde-fous en production sont notés sur trois chiffres : taux de refus, taux de succès d’attaque (ASR) et taux de violation de politique. L’argument du papier est que ces chiffres répondent à une question locale — comment le contrôle s’est comporté sur les requêtes contre lesquelles il a été testé — alors qu’un déploiement a besoin de la réponse à une autre question : quelle aide à une tâche nuisible le service fournit-il encore à un attaquant qui s’adapte ou qui trouve un autre chemin d’entrée. Les auteurs relisent les résultats publiés à l’aune de ce second critère, de sorte que des affirmations issues de familles de garde-fous différentes (filtrage, fine-tuning de sûreté, désapprentissage, classifieurs) deviennent comparables sous un standard unique, au niveau du déploiement.

Comment ça fonctionne

Le résultat porte sur la preuve, pas sur un payload. Le papier montre que les exigences de preuve sont fortement asymétriques :

Affirmation                  Ce qu'il faut pour l'établir
---------------------------  ------------------------------------------------
« Une aide nuisible          UNE attaque qui obtient de l'aide nuisible du
  subsiste dans ce           service déployé. Suffisante à elle seule. Les
  déploiement. »             auteurs notent que de telles attaques reviennent
                             régulièrement dans le corpus codé.

« Il ne subsiste guère       NE PEUT PAS découler des chiffres du garde-fou
  d'aide nuisible. »         lui-même. Exige une preuve distincte sur ce que
                             le SYSTÈME ENVIRONNANT autorise encore une fois
                             que le garde-fou a rempli sa fonction locale.

Cette asymétrie est la forme classique d’une preuve de sécurité — la présence est peu coûteuse à démontrer, l’absence l’est beaucoup — mais elle est systématiquement ignorée quand un éditeur de garde-fou ou un papier annonce « ASR réduit de 62 % à 4 % ». Le 4 % décrit la distribution de requêtes testée. Il ne dit rien de l’attaquant adaptatif, du chemin d’entrée alternatif, ni de la couche d’action située derrière le filtre.

Le second résultat de l’audit est le plus tranchant. Sur l’ensemble des affirmations que les auteurs ont codées en profondeur, la preuve portant sur la capacité résiduelle au niveau système n’est étayée ou dérivée que dans une petite minorité de cas, et une seule de ces affirmations borne effectivement son résiduel. Autrement dit : la discipline mesure le contrôle, presque jamais le système. Un meilleur score local n’est donc pas, en soi, une affirmation plus forte sur le déploiement.

Un papier de septembre 2026 pointe la même lacune sous l’angle de la composition. Capability-Gated Language Models: Security Composes, Utility Does Not (31 août 2026) formalise un contrôle d’accès par principal à l’intérieur d’un même jeu de poids et constate que les restrictions se composent de façon prévisible du côté sécurité, mais pas du côté utilité : des profils de restriction individuellement inoffensifs peuvent se composer en dégradation de rétention et de fluidité, sans aucune borne compositionnelle. Empiler des garde-fous n’est pas une opération gratuite, et le coût atterrit là où on le mesure le moins.

Pourquoi c’est important

Cela reformule trois conversations opérationnelles.

Achat. La réduction d’ASR affichée par un fournisseur est une affirmation sur son jeu d’évaluation, pas sur votre stack. Selon le critère du papier, ce chiffre ne peut pas soutenir « notre déploiement est sûr » — il peut seulement ne pas le contredire. La question à poser porte sur ce que le système permet encore après le déclenchement du garde-fou : quels outils restent appelables, quels chemins de sortie restent ouverts, quelles données restent à portée.

Incitations de recherche. Si l’unité publiable est un score local, l’effort se porte sur l’augmentation des scores locaux. Les auteurs sont explicites : la recherche sur les garde-fous ne peut pas s’arrêter là — un gain doit être jugé à sa capacité à rendre un système déployé plus sûr. Des benchmarks qui ne modélisent jamais le système environnant continueront de récompenser des travaux qui ne se transfèrent pas.

Exploitation. Le rapport 2026 de l’OWASP GenAI Security Project sur l’état de la sécurité de l’IA agentique, résumé en juin 2026, documente la conséquence : l’injection de prompt est rattachée à six des dix catégories du Top 10 agentique, et les incidents réels se concentrent sur ce que le système autorisait une fois le modèle abusé — commandes en liste blanche transportant des payloads, frontières de bac à sable redéfinies par la sortie de l’agent, modèles de permissions qui échouent à l’identique que le déclencheur soit un attaquant ou une erreur. Rien de tout cela n’apparaît dans un taux de refus.

Défenses

Le correctif n’est pas d’abandonner les garde-fous. C’est de cesser de traiter leurs scores comme des preuves de déploiement, et de mesurer ce qui borne réellement votre risque.

  1. Mesurez la capacité résiduelle, pas la précision du filtre. Définissez ce qu’un attaquant réussi pourrait encore atteindre en supposant que le garde-fou a fonctionné comme prévu. C’est ce chiffre — pas l’ASR — qui constitue votre énoncé de risque.

  2. Exigez des bornes résiduelles cadrées de vos fournisseurs. Demandez quelle population d’attaques l’évaluation couvrait, si les attaquants adaptatifs étaient dans le périmètre, et ce que le fournisseur affirme du système environnant. « Non borné » est une réponse acceptable ; un ASR brut présenté comme une affirmation de sûreté ne l’est pas.

  3. Architecturez pour qu’un contournement reste survivable. Listes blanches de sortie, identifiants à durée de vie courte et à portée étroite, environnements d’exécution isolés, validation humaine sur les actions irréversibles : tout cela réduit la capacité résiduelle, que le classifieur se déclenche ou non. Voir le triptyque létal et la règle des deux sur trois pour les agents.

  4. Faites du red team sur le système, pas sur le classifieur. Un test qui s’arrête à « le filtre a bloqué » mesure le contrôle. Poursuivez le test au-delà du blocage : quel autre chemin atteint la même capacité ?

  5. Budgétez le coût de composition. D’après le résultat sur le capability gating, des restrictions empilées se composent côté sécurité mais pas côté utilité. Traitez la régression de capacité comme une métrique de premier rang quand vous empilez des défenses, sinon vous payez silencieusement une protection que vous ne pouvez pas démontrer.

  6. Séparez données et instructions en amont. Le filtrage local est une couche posée sur un problème d’architecture : les modèles lisent le prompt système, la requête utilisateur et le contenu récupéré comme un seul flux de tokens. Le filtrage de sortie et les contrôles de flux d’information traitent des parties différentes de ce problème et doivent être évalués séparément.

Status

ÉlémentRéférenceDateNotes
The Safeguard Worked. Is the LLM System Safer?arXiv:2609.005192026-09-01Audit des publications sur les garde-fous selon un critère de déploiement
Capability-Gated Language ModelsarXiv:2609.004452026-08-31La sécurité se compose ; l’utilité n’a aucune borne compositionnelle
OWASP State of Agentic AI Security and Governance v2.01Synthèse Help Net Security2026-06-11L’injection de prompt couvre 6 des 10 catégories du Top 10 agentique

Aucune vulnérabilité n’est divulguée ici et aucun produit n’est mis en cause. L’enseignement est méthodologique et actionnable dès aujourd’hui : le score d’un garde-fou mesure un contrôle, et votre risque vit dans le système qui l’entoure. Tant qu’une affirmation n’est pas accompagnée d’une preuve sur ce que ce système autorise encore, un taux de succès d’attaque plus bas est un meilleur résultat local, et rien de plus.

Sources