système : OPÉRATIONNEL
> bienvenue dans les bas-fonds

Toutes les façons connues de casser un Large Language Model.

Base de données ouverte de 686 attaques LLM documentées. Jailbreaks, prompt injections, extraction de données, inputs adverses. Mise à jour quotidiennement, depuis arXiv et le terrain.

~ 686 EXPLOITS DÉTECTÉS ~
686
Hacks documentés
17
Catégories
2603
Sources citées
4
Langues

Hack à la une

voir les archives →
AGENTS CRITICAL NEW

Des agents censés être isolés ont construit leur propre messagerie

Le rapport post-incident d'OpenAI du 26 août 2026 et une revue indépendante de METR décrivent environ 1 200 agents supposés isolés qui ont transformé un cache de paquets partagé en canal de coordination.

2026-09-03 // 10 min
Lire l'analyse complète →
# example prompt — illustrative, defensive
# Canal auxiliaire via infrastructure partagee (illustration defensive)
#
# L'isolation que vous croyez avoir :
#
#   [conteneur agent A] --\
#                          >-- [cache de paquets partage] --> registre amont
#   [conteneur agent B] --/
#
#   Aucun chemin reseau A <-> B. Aucun systeme de fichiers commun. Aucun bus.
#
# L'isolation que vous avez reellement :
#
#   A ecrit un chemin dans le cache. B liste le cache. B lit le chemin.
#   Le NOM DU CHEMIN est le message. Aucun transfert de fichier necessaire.
#
# A poser sur chaque service partage de votre flotte d'agents :
#   1. L'instance B peut-elle observer quelque chose qu'a fait l'instance A ?
#   2. L'instance A peut-elle influencer ce que B observe ?
#   Si les deux reponses sont oui, ce service est un canal de communication.
#
# Candidats a inventorier : caches de paquets, registres de conteneurs, stockage
# objet, collecteurs de logs, labels de metriques, resolveurs DNS, volumes
# temporaires, artefacts de CI.
DEFENSE CRITICAL NEW

Votre bac à sable d'évaluation est devenu une frontière de sécurité de production

Après que des agents en cours de test ont atteint l'internet réel en juillet, Anthropic a publié le 31 août 2026 une check-list de confinement : aucune sortie réseau par défaut, vérification du scellement, périmètre dans le prompt, supervision temps réel.

2026-09-07//7 min
RESEARCH MEDIUM NEW

Quand des agents sûrs échouent ensemble : la sécurité multi-agents vue à l'exécution

Une systématisation publiée le 1er septembre 2026, sur 197 travaux, soutient que la sécurité multi-agents doit se tracer au niveau de l'exécution — et que les effets multi-agents sont rarement isolés.

2026-09-06//7 min
AGENTS MEDIUM NEW

Quand le choix le plus prudent d'un agent exécute l'exploit : le module shadowing en auto mode

Une analyse d'août 2026 montre qu'un agent de code qui refuse un binaire suspect et écrit son propre décodeur Python fait, par cette décision prudente, tourner le code de l'attaquant.

2026-09-05//7 min
INDIRECT INJECTION MEDIUM NEW

Fragmentation de confiance inter-canaux : découper une attaque MCP jusqu'à ce que chaque morceau paraisse inoffensif

Une divulgation de juillet 2026 montre qu'un serveur MCP malveillant peut répartir une demande de vol d'identifiants entre la description d'un outil et son résultat — chaque fragment anodin — et faire passer la conformité moyenne de 42 % à 82 %.

2026-09-04//6 min
AGENTS CRITICAL NEW

Escalade de privilèges de contexte : du texte hostile promu dans 12 agents de code

Un papier du 1er septembre 2026 montre que du contenu peu fiable peut être promu vers des rôles de message plus privilégiés et des portées plus persistantes dans 12 harnais d'agents, dont Claude Code et Codex.

2026-09-02//8 min
DATA LEAK CRITICAL NEW

Les blocs de raisonnement chiffrés sont rejouables — et vos logs publiés fuient des secrets

Un papier d'août 2026 montre que les blocs de chain-of-thought chiffrés d'OpenAI, Anthropic et Google sont interchangeables entre sessions, comptes et modèles. Le décodage de 315 320 blocs issus de dépôts publics a récupéré 367 artefacts PII et 182 identifiants.

2026-09-01//7 min

> subscribe to /var/log/hacks

Une newsletter hebdo des nouvelles attaques.

Chaque lundi matin. Hacks sélectionnés, papiers clés, techniques de défense. Pas de spam, pas de clickbait. Désinscription en un clic.