sistema: OPERATIVO
← volver a todos los hacks
AGENTS MEDIUM NEW

El punto ciego en la escritura de las defensas contra el envenenamiento de memoria

Un banco de pruebas de julio de 2026 clasifica los ataques a la memoria persistente en tres niveles de dificultad — y muestra que los filtros de escritura que frenan el veneno evidente apenas contienen las variantes distribuidas y latentes.

2026-07-20 // 6 min affects: llm-agents, agent-memory-systems, rag-pipelines

¿Qué es esto?

El 16 de julio de 2026, investigadores de la Universidad de Nanjing publicaron en arXiv un artículo que presenta un banco de pruebas y un marco de análisis del envenenamiento de la memoria persistente en agentes LLM. Los asistentes modernos conservan una memoria externa a largo plazo — preferencias, hechos, estado de tareas, notas de traspaso — para que una sesión se reanude con continuidad. Esa misma persistencia es una superficie de ataque duradera: el contenido inyectado por un canal ordinario puede sobrevivir más allá de su turno original y orientar el comportamiento mucho después. La contribución aquí no es un nuevo exploit sino una medición. Los autores construyen un conjunto congelado de 1.227 casos validados a mano, lo ejecutan sobre diez familias de modelos y ordenan el envenenamiento de memoria en tres niveles estructurales. El resultado principal: las defensas económicas aplicadas en la escritura atrapan el nivel más visible y pasan por alto en gran medida los otros dos.

Cómo funciona

El artículo organiza el envenenamiento como una escalera de dificultad definida por la distancia entre la inyección y el daño.

L1 — corrupción de registro único. Un único registro explícitamente dañino cuya intención es visible en la escritura (por ejemplo, una memoria que afirma que un punto de acceso de producción migró a un host controlado por el atacante). Es el caso que un control de plausibilidad o seguridad en la admisión debería interceptar.

L2 — corrupción composicional. La carga se reparte entre varios registros individualmente plausibles, inyectados a lo largo del tiempo. Cada uno parece inocuo por separado; el daño solo se manifiesta cuando los fragmentos se recuperan juntos y se componen en una tarea posterior. Los filtros de admisión por registro no ven nada anómalo en ningún fragmento aislado.

L3 — corrupción latente activada por contexto. Un registro inerte en uso normal, que solo se activa cuando aparece más tarde un contexto natural específico (una instrucción «durmiente» que se dispara en una tarea recurrente concreta). En la admisión se lee como neutral.

El modelo de amenaza es deliberadamente débil: el atacante no tiene acceso a los pesos, ni a los prompts del sistema, ni a las entrañas de la base de memoria, y solo escribe por canales estándar — entrada del usuario, salidas de herramientas o mensajes entre agentes. Para explicar por qué las defensas se comportan de forma distinta según el nivel, los autores añaden la Mechanistic Influence Decomposition (MID), un método contrafactual que elimina elementos de memoria y mide el cambio en la salida — aislando la influencia de un registro solo, la interacción por pares y la activación condicionada por el disparador, firmas respectivas de L1, L2 y L3.

Por qué importa

Sin defensa, los diez modelos se mantuvieron muy precisos en tareas limpias (alrededor del 94 % de media) pero resultaron muy corruptibles, con una tasa de corrupción del comportamiento media del 62,5 %, que iba de aproximadamente el 54 % al 67 % según las familias. La corrupción crecía a lo largo de la escalera: desglosada por nivel, las tasas sin defensa eran de cerca del 45 % (L1), 52 % (L2) y 77 % (L3). Las escrituras mediadas por el exterior — retornos de herramientas y mensajes entre agentes — corrompían la memoria con más frecuencia que la entrada directa del usuario, y las memorias «planas» estaban más expuestas que los almacenes de hechos descompuestos.

Es en las defensas donde el hallazgo muerde. Un control de coherencia en la escritura redujo la corrupción L1 por debajo del 5 % — pero dejó L2 cerca del 23 % y L3 cerca del 28 %. Dicho de otro modo, el filtro que neutraliza el caso evidente apenas mueve los casos distribuidos y latentes. El mejor resultado provino de apilar defensas a lo largo de toda la cadena (un conjunto alcanzó cerca del 11 % global), pero persistía una corrupción residual, concentrada en L2 y L3. La MID da la razón estructural: un filtro de admisión solo puede juzgar un registro en el momento en que se escribe; un daño diferido — ensamblado más tarde a partir de piezas inocuas, o desbloqueado por un contexto futuro — cae en un punto ciego que ningún control de escritura puede ver.

Defensas

En la práctica, hay que dejar de tratar la admisión en la escritura como la línea de defensa principal, y dejar de puntuar la higiene de la memoria con una única tasa de éxito de ataque. El filtrado en la escritura sigue siendo útil como suelo contra L1, pero combínelo con controles en la recuperación y en el comportamiento: pondere o bloquee las memorias recuperadas según la procedencia y la independencia de las fuentes, para que fragmentos recuperados juntos de un mismo origen no fiable no puedan formar una carga en silencio, y aplique un razonamiento sensible a los conflictos que señale las memorias recuperadas que contradigan el estado de confianza antes de actuar. Trate las salidas de herramientas y los mensajes entre agentes como escrituras de memoria de mayor riesgo que la entrada directa del usuario, y prefiera representaciones de memoria descompuestas frente al almacenamiento literal por bloques cuando sea viable.

Como el comportamiento dañino en L2 y L3 solo aparece en la recuperación o en el disparo, la vigilancia también debe desplazarse aguas abajo: registre qué memorias motivaron una acción de consecuencias y prevea una auditoría a posteriori capaz de atribuir una mala salida a los registros responsables, un enfoque explorado por trabajos concurrentes sobre forense de memorias envenenadas. Someta a red team las cadenas de memoria con casos composicionales y latentes, no solo con registros evidentes aislados, y evalúe las defensas etapa por etapa — admisión, recuperación, comportamiento — en lugar de reportar una puntuación agregada que oculte dónde falla realmente la cadena. Estos controles concuerdan con las recomendaciones de OWASP sobre el envenenamiento de memoria y datos para aplicaciones LLM agénticas.

Estado

ElementoDetalle
ContribuciónBanco de pruebas + análisis mecanicista del envenenamiento de memoria persistente
TaxonomíaL1 registro único · L2 composicional · L3 latente activado por contexto
Banco de pruebas1.227 casos validados a mano · 10 familias de modelos · 3 sustratos de memoria
Corrupción sin defensa~62,5 % de media (L1 ~45 % · L2 ~52 % · L3 ~77 %)
Control de coherencia en escrituraL1 <5 % · L2 ~23 % · L3 ~28 % (punto ciego en L2/L3)
Mejor defensa (conjunto)~11 % global, corrupción residual en L2/L3

Fecha clave: artículo del banco de pruebas publicado en arXiv el 16 de julio de 2026.

Sources