sistema: OPERATIVO
← volver a todos los hacks
AGENTS MEDIUM NEW

Lucid: una imagen imperceptible puede reescribir la memoria de un agente multimodal

Un artículo de julio de 2026 muestra que un atacante de caja negra que solo controla una imagen —sin acceso al modelo, sin texto— puede corromper lo que un agente multimodal «recuerda» y orientar sus respuestas futuras. Probado en cinco arquitecturas de memoria, incluida una comercial.

2026-07-21 // 6 min affects: multimodal-ai-agents, mllm-agents, vision-language-models, agent-memory-systems

¿Qué es esto?

El 20 de julio de 2026, Halima Bouzidi, Mboutidem Ekemini Mkpong y Mohammad Abdullah Al Faruque publicaron en arXiv un artículo titulado «Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents». Presenta un marco de ataque llamado Lucid. Se trata de un estudio de laboratorio realizado en entornos controlados, no de un incidente real.

El hallazgo es acotado pero contundente. Los agentes multimodales que mantienen una memoria a largo plazo —un almacén de imágenes y textos pasados que pueden recuperar después— confían en las imágenes de esa memoria como si fueran registros fieles. Lucid demuestra que un atacante que solo controla una imagen, sin acceso al modelo, al sistema de recuperación ni al texto que la rodea, puede introducir una perturbación imperceptible y cambiar lo que el agente recordará y afirmará más adelante. El usuario ve una imagen normal y una respuesta normal, y nunca se entera de que la memoria fue manipulada.

Cómo funciona

Lucid opera bajo lo que los autores llaman un modelo de amenaza de caja negra estrictamente limitado a la imagen. El atacante no necesita ver el interior del modelo de visión y lenguaje, ni el codificador de recuperación que indexa las memorias, y no toca el canal de texto. Solo influye en los píxeles de una imagen que el agente va a almacenar o razonar. La perturbación está diseñada para ser visualmente imperceptible, de modo que sobrevive a una revisión humana superficial.

A partir de ahí, el artículo describe dos modos de fallo distintos. En el envenenamiento de memoria, un ataque en contexto, la imagen adversaria reemplaza a una benigna cuyo significado estaba reforzado por el texto circundante; esto corrompe el recuerdo visual del agente y lo orienta hacia una narrativa elegida por el atacante en turnos posteriores. En la inyección de memoria, un ataque fuera de contexto, la imagen adversaria aparece en un turno de conversación sin anclaje textual previo, por lo que no hay señal correctiva desde la memoria y el agente genera directamente respuestas influidas por el atacante.

Lo llamativo es el alcance. Los autores evalúan Lucid en varios dominios de conversación y cinco arquitecturas de memoria de caja negra, incluida una memoria con estructura de grafo, una memoria resumida por LLM y un sistema desplegado comercialmente. Alcanzan una tasa de éxito del 61,6 % en envenenamiento y del 58,4 % en inyección. Aquí no se reproduce ninguna receta de perturbación ni carga útil; lo que importa es el mecanismo.

Por qué importa

La mayoría de los ataques de memoria publicados llegan por el texto: un correo trampa, un documento falsificado, una instrucción oculta en una página web. Lucid cierra el supuesto de que una imagen sería más segura que la prosa. Si un agente fotografía un recibo, captura un panel, acepta una imagen compartida o la extrae de una página para archivarla en memoria a largo plazo, esa imagen es ahora una escritura no confiable en un estado duradero. La corrupción persiste entre sesiones y moldea decisiones mucho después de que el turno original desapareciera de la pantalla; y como el cambio vive en los píxeles y no en las palabras, los filtros de entrada de texto y el endurecimiento de instrucciones nunca lo ven.

Esto se suma a una línea de trabajo en rápida expansión sobre la memoria multimodal como superficie de ataque, entre ella el envenenamiento activado de memorias multimodales de agentes web y el envenenamiento de memoria contra recomendadores agénticos. Es la contraparte visual de las escrituras sigilosas por el canal de texto como MemGhost: en todos los casos, el contenido externo se convierte en estado interno de confianza sin que exista un momento visible en el que alguien lo aprobara —el mismo punto ciego en el momento de la escritura que atraviesa la memoria de los agentes en general.

Defensas

Trate cada imagen almacenada como entrada no confiable, no como verdad de referencia. Etiquete la procedencia de las memorias para que un agente pueda juzgar si una imagen recuperada proviene de una captura de confianza o de una fuente externa alcanzable por un atacante, y no permita que imágenes no confiables se promuevan en silencio a memoria duradera que condiciona decisiones. Como Lucid es de caja negra e imperceptible, el ojo humano no la detectará: los defensores deben apoyarse en conjuntos y comprobaciones cruzadas —corroborar una imagen recuperada con el texto que la acompañaba, señalar los turnos en los que una sola imagen sin anclaje textual dicta una decisión, y exigir confirmación antes de que un recuerdo basado solo en la imagen active una acción con consecuencias. El preprocesamiento de purificación y robustez adversaria sobre las imágenes que entran en memoria encarece el coste de una perturbación aprovechable, aunque los resultados de caja negra del artículo advierten de no considerar ningún filtro aislado como suficiente. Sobre todo, mantenga las escrituras y lecturas de memoria dentro de un perímetro de seguridad con registro, para que un recuerdo envenenado pueda rastrearse y revertirse —véanse las recomendaciones de OWASP sobre la memoria de los agentes para controles que implementar.

Estado

ElementoDetalle
DivulgaciónArtículo de arXiv anunciado el 20 de julio de 2026
NaturalezaAtaque adversario de caja negra, solo con imagen, sobre la memoria a largo plazo de agentes multimodales (envenenamiento e inyección)
Modelo de amenazaSin acceso al MLLM objetivo, al codificador de recuperación ni al canal de texto; solo una perturbación de imagen imperceptible
Probado enCinco arquitecturas de memoria de caja negra, incluidas grafo, resumida por LLM y sistema comercial desplegado
Éxito61,6 % de éxito (envenenamiento); 58,4 % (inyección)
Requisito previoLa imagen adversaria debe llegar al pipeline de memoria del agente; solo laboratorio, sin abuso constatado en la práctica
ClaseEnvenenamiento de memoria multimodal por perturbación adversaria; falta de procedencia y de aprobación en la escritura

Las cifras reflejan el banco de pruebas de los autores, ejecutado en entornos de laboratorio sellados sobre versiones concretas de modelos y memoria. El comportamiento de los agentes y las defensas cambian entre versiones: verifique en la versión actual de cualquier despliegue antes de sacar conclusiones.

Sources