Les évaluations de confidentialité des agents ne surveillent qu'une sortie sur deux
Un papier arXiv du 16 septembre 2026 nomme le déplacement d'exposition et le chiffre : ne regarder que la sortie attendue fait manquer 46,9 % de ce que révèle l'union des sorties visibles.
De quoi s’agit-il ?
Le 16 septembre 2026, cinq auteurs — Guosen Wu, Huizhen Huang, Guoxiong Long, Tao Huang et Chen Hou — ont déposé ASLEval sur arXiv cs.CR. Huit pages consacrées à une erreur de mesure, pas à une attaque, et c’est la publication la plus utile du mois sur la confidentialité des agents.
Cette erreur porte désormais un nom : le déplacement d’exposition (privacy exposure displacement), défini comme l’écart entre un indicateur d’évaluation local et l’exposition réelle de la session, mesurée par rapport à des cibles définies. En clair : la plupart des évaluations de confidentialité des agents outillés inspectent une action désignée, la réponse finale, ou l’auto-déclaration d’un attaquant. Une session d’agent dispose de bien plus de sorties que cela. Ce qui s’échappe par une autre voie n’est pas compté, donc n’existe pas.
Retenez le chiffre principal : sur plusieurs environnements de type entreprise et deux runtimes implémentés indépendamment, une vue limitée à la sortie attendue manque 46,9 % de l’exposition que récupère l’union de toutes les sorties visibles déclarées.
Comment ça fonctionne
L’apport d’ASLEval est un contrat de mesure plutôt qu’une technique. Trois choix de conception font le travail.
Pré-enregistrer un ensemble de cibles caché. Décider à l’avance quels éléments précis comptent comme sensibles, et scorer par rapport à eux — pas par rapport à l’impression qu’un juge retire de la transcription. Sans cibles pré-spécifiées, il n’existe aucune vérité terrain commune entre sorties, rapports et chemins d’outils, et deux benchmarks peuvent diverger simplement parce qu’ils n’ont pas étiqueté les mêmes choses.
Déclarer la frontière visible complète. Énumérer tous les canaux par lesquels du contenu peut quitter la session — et pas seulement celui que le scénario attend — puis mesurer l’union. C’est à cette union que se compare le chiffre de 46,9 %.
Réserver les traces internes au diagnostic, pas au score. Les indices intermédiaires internes à la boucle de l’agent sont écartés du verdict et servent à l’expliquer. Le constat est directionnel : les indices internes alignés sur le schéma précèdent généralement l’exposition visible, au niveau de la requête ou de la sonde.
ce que la plupart des évals scorent ce qu'ASLEval score
─────────────────────────────────── ───────────────────
┌─ sortie attendue ─┐
sortie attendue uniquement ──────► ├─ autre sortie ─┤──► union
├─ chemin d'outil ─┤ (+46,9 %)
└─ canal alternatif ─┘
│
traces internes ──► diagnostic seulement
Deux autres résultats comptent pour quiconque lit un score de confidentialité. Les auto-déclarations d’attaquant cumulent omissions et fort taux de fausses découvertes — un modèle attaquant à qui l’on demande s’il a obtenu la donnée se trompe dans les deux sens à la fois, son rapport ne remplace donc pas l’observation. Et réduire ce que le modèle voit en retour déplace le chemin d’exposition mais peut détruire la réussite des tâches normales : la mitigation évidente, en montrer moins au modèle, n’est pas gratuite.
Pourquoi c’est important
Le résultat arrive dans une littérature qui dérive vers les indicateurs indirects depuis deux ans, et il explique un motif déjà visible.
Revenons à AgentDAM (arXiv 2503.09780), un benchmark de 246 tâches sur la minimisation des données chez les agents de navigation web. Ses auteurs ont mené la même comparaison en miniature : demander au modèle si divulguer un élément serait approprié (probing), puis observer ce que l’agent fait réellement. L’écart est large et constant dans sa direction — gpt-4o obtient 0,915 en probing et 0,646 en action ; gpt-4o-mini, 0,890 contre 0,557. Interroger un modèle sur la confidentialité mesure ses normes déclarées. L’exécuter mesure son comportement. Ce sont deux grandeurs distinctes.
Vient ensuite AgentCIBench, publié le 22 juin 2026 par Anmol Goel et Iryna Gurevych au UKP Lab sous le titre Capable but Careless. Il score de façon déterministe les défaillances d’intégrité contextuelle sur un espace de travail à six applications, à partir de 128 scénarios sources écrits à la main, via un matcher couplé à un juge LLM et fusionné de manière conservatrice. Son propre cadrage est révélateur : parce que le refus masque la fuite brute, la métrique principale est la fuite conditionnée à l’engagement, Leng = L / (1 − R). Leur conclusion affichée — l’utilité en accomplissement de tâche ne prédit pas la retenue en divulgation — signifie qu’un agent compétent et un agent prudent sont deux axes indépendants. L’évaluation rapportée sur 15 agents de pointe relève 11 d’entre eux fuyant sur plus de la moitié des scénarios, avec une moyenne de 67,9 %.
Alignez les trois et la conclusion dérange : les taux de fuite publiés sont des planchers, pas des estimations. Le probing surestime la retenue. Le score limité à la sortie attendue sous-estime l’exposition d’environ moitié. Le refus gonfle le dénominateur si l’on ne corrige pas. Tous les biais connus de cette chaîne de mesure pointent dans le même sens.
Les conséquences sont directes en achat. Un score de confidentialité fournisseur ne vaut que ce que vaut l’ensemble de sorties sur lequel il a été calculé, et presque aucun ne précise cet ensemble. Nous avons tenu le même raisonnement sur les scores de garde-fous qui ne sont pas des preuves de déploiement et sur les benchmarks de sécurité qui se contredisent ; voici l’instance propre à la confidentialité, chiffrée.
Défenses
Demandez à tout chiffre de confidentialité quel était son ensemble de sorties. Avant de comparer deux agents, établissez si les deux ont été scorés sur l’union des sorties visibles ou seulement sur la sortie attendue. Si le rapport ne le dit pas, traitez le chiffre comme une borne inférieure et écrivez-le noir sur blanc. C’est aujourd’hui la question la plus rentable d’une revue fournisseur IA.
Énumérez vos propres sorties avant d’instrumenter. Dans votre déploiement, listez chaque canal par lequel du contenu peut sortir : réponse de l’assistant, messages et e-mails sortants, écritures de fichiers, arguments d’outils envoyés à des tiers, journaux, télémétrie, requêtes de recherche, charges utiles de webhooks. La plupart des équipes découvrent des canaux qu’elles n’avaient pas comptés. On ne surveille pas une frontière qu’on n’a pas écrite. Cela prolonge naturellement la divulgation liée à une finalité — la finalité contraint le quoi, l’ensemble de sorties contraint le où.
Pré-enregistrez les cibles dans vos tests internes. Décidez quels enregistrements comptent comme sensibles avant la run, pas en relisant la transcription après. L’étiquetage a posteriori laisse un juge noter ce qu’il remarque, c’est-à-dire exactement la défaillance qu’ASLEval formalise.
N’acceptez pas l’auto-déclaration d’un modèle comme preuve. Cela vaut pour les modèles attaquants des harnais de red team, comme pour les agents de production à qui l’on demande de signaler leurs propres divulgations. Le constat est : omissions plus fort taux de fausses découvertes — faux dans les deux sens, l’erreur ne se compense donc pas.
Alertez sur les précurseurs au niveau requête. Puisque les indices internes alignés sur le schéma précèdent généralement l’exposition visible, une requête dont la forme épouse le schéma sensible constitue un signal disponible avant que quoi que ce soit ne sorte. Inspecter les arguments d’appel d’outil coûte moins cher que reconstituer l’exposition après coup, et c’est le même point d’instrumentation que pour les appels d’outils fantômes.
Publiez confidentialité et utilité ensemble. Les deux papiers convergent : restreindre ce que le modèle voit en retour peut détruire la réussite des tâches normales, et l’utilité ne prédit pas la retenue. Un chiffre de confidentialité sans le chiffre de réussite qui l’accompagne n’est pas interprétable, et réciproquement.
Statut
| Élément | Détail |
|---|---|
| Source principale | Wu G., Huang H., Long G., Huang T., Hou C., ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions, arXiv:2609.18864 [cs.CR] |
| Date | Déposé le 16 septembre 2026 (v1) ; 8 pages, 3 figures |
| Licence | CC BY-NC-SA 4.0 |
| Concept central | Déplacement d’exposition — écart entre un indicateur d’évaluation local et l’exposition de session mesurée sur cibles |
| Chiffre principal | La vue limitée à la sortie attendue manque 46,9 % de l’exposition récupérée par l’union des sorties visibles |
| Constats secondaires | Les auto-déclarations d’attaquant cumulent omissions et fort taux de fausses découvertes ; les indices internes alignés sur le schéma précèdent l’exposition visible ; réduire les retours visibles par le modèle peut détruire la réussite des tâches normales |
| Méthode | Ensemble de cibles caché pré-enregistré ; toutes les sorties visibles déclarées mesurées ; traces internes réservées au diagnostic ; revue humaine indépendante du pipeline d’arbitrage |
| Travaux corroborants | Goel A., Gurevych I., Capable but Careless, arXiv:2606.23189, 22 juin 2026 — AgentCIBench, 128 scénarios sources, espace à six applications, fuite conditionnée à l’engagement Leng = L / (1 − R) |
| Antériorité | AGENTDAM, arXiv:2503.09780 — 246 tâches ; les scores de confidentialité par probing et en action divergent (gpt-4o 0,915 / 0,646 ; gpt-4o-mini 0,890 / 0,557) |
| Statut éditeur | Pas une vulnérabilité produit ; aucun advisory, correctif ni divulgation coordonnée applicable |
| Statut pratique | Recommandations de benchmarking, actionnables dès aujourd’hui en achat et en conception de red team interne |