sistema: OPERATIVO
← volver a todos los hacks
DATA LEAK MEDIUM NEW

Ataques de inferencia de contexto: filtrar sin jailbreak

Un artículo de agosto de 2026 formaliza los ataques de inferencia de contexto: un agente filtra señales explotables sobre los registros que cargó, sin llegar a divulgarlos.

2026-09-21 // 6 min affects: llm-agents, rag, web-browsing-agents, mcp, a2a

¿De qué se trata?

La mayor parte de la investigación sobre privacidad en sistemas LLM ha medido una sola cosa: ¿puede un atacante lograr que el modelo diga el secreto? Extracción mediante jailbreak, volcado del system prompt, regurgitación literal. Un artículo enviado a arXiv el 31 de agosto de 2026, Context Inference Attacks Without Jailbreaks (arXiv:2609.01663), de Prince Jha, Samuele Poppi y Nils Lukas, sostiene que ese encuadre pasa por alto por completo el caso agéntico.

En un despliegue agéntico, el material sensible —historiales clínicos, documentos financieros, tickets internos— no lo pega el usuario. Lo ensambla en un contexto oculto el propio agente mediante sus llamadas a herramientas, y después el agente responde preguntas corrientes e inocuas sobre esa base. Los autores formalizan los ataques de inferencia de contexto: un atacante que nunca obtiene una divulgación puede aun así determinar qué registros se cargaron, únicamente a partir de las respuestas normales del agente.

Cómo funciona

El artículo plantea el problema como un juego de seguridad. El atacante envía consultas inocuas, observa las respuestas y puntúa contextos candidatos: el objetivo es identificar el verdadero dentro de un conjunto de candidatos, no hacer que el modelo lo recite. Nada en la interacción parece un ataque: no hay sufijo adversario, ni juego de rol, ni rechazo que sortear.

Se evalúan tres escenarios, con conocimiento decreciente del atacante y entrega del contexto cada vez más indirecta:

  • Contexto conocido: el atacante conoce los registros candidatos.
  • Contexto desconocido: se desconocen la plantilla del prompt y los registros circundantes.
  • Contexto recuperado por el agente: los registros llegan por las propias llamadas de recuperación del agente, sin que el atacante toque la ruta de carga.

Los autores distinguen además un escenario grey-box, en el que el propio modelo objetivo se usa para puntuar observaciones, de otro black-box, en el que el atacante puntúa con un modelo sustituto bajo su control. El mismo ataque atraviesa los tres escenarios sin modificaciones.

Las cifras reportadas, frente a tasas de azar de 1/|candidatos| y 50 AUROC respectivamente: 100 % de éxito en conjuntos pequeños de candidatos y 63 % con 1.024 candidatos en contexto conocido; 78,9 AUROC cuando la plantilla y los registros circundantes son desconocidos; 92,5 AUROC cuando un sustituto de 14 000 millones de parámetros puntúa un objetivo de 32 000 millones; 81,8 AUROC cuando los registros llegan como retornos de recuperación del agente. La filtración se caracteriza en función del presupuesto de consultas, el tamaño del contexto y el tamaño del modelo objetivo.

Por qué importa

Lo incómodo es el conjunto de controles probados. Los autores indican que los agentes evaluados siguieron siendo vulnerables pese a las mitigaciones aplicadas: una instrucción de no divulgar el contexto, la supresión de logits y la dilución del contexto. Esas tres medidas son, en la práctica, aquello en lo que se apoya buena parte de los despliegues en producción: una cláusula firme en el system prompt, un filtro de salida y mucho texto alrededor.

Ninguna aborda la filtración real, porque esta no está en el texto de salida. Está en la distribución de las salidas inocuas condicionada por el contexto. Un agente de navegación web que responde una pregunta inofensiva sigue portando señal explotable sobre lo que se cargó en silencio. Y la pertenencia de un registro —«¿estaba este historial dentro del alcance?»— suele ser por sí sola el dato sensible, con independencia del contenido.

Un estudio controlado distinto, publicado el 1 de septiembre de 2026 (arXiv:2609.01693), apunta en una dirección convergente respecto a las etiquetas de sensibilidad dentro del contexto. En 480 ensayos sobre una única configuración MCP-a-A2A, una cabecera PUBLIC - OK TO SHARE quedó descriptivamente asociada a más fuga literal de campos que la ausencia de cabecera, con fuerte dependencia del modelo; el contraste entre «confidencial» y «sin etiqueta» resultó limitado por efecto suelo y no concluyente. El autor precisa explícitamente que se trata de una asociación en una configuración, no de un efecto causal ni general, pero es un motivo más para no tratar una etiqueta de sensibilidad situada en el contexto como un mecanismo de aplicación.

Defensas

La aportación del artículo en este terreno es negativa: muestra qué controles no resistieron. Las recomendaciones siguientes se derivan, por tanto, del modelo de amenaza y no de mitigaciones medidas.

Deje de contar el secreto a nivel de prompt como un control. «No reveles el contexto» es una instrucción dirigida a un componente que filtra por su distribución de salida, no una frontera. Trátela como higiene, nunca como la razón por la que una evaluación se da por superada.

Convierta el alcance de la recuperación en una decisión de autorización, no en un detalle del prompt. Si un registro no debe ser inferible por un solicitante determinado, no debe entrar en el contexto de ese solicitante. Filtre en la capa de recuperación y de permisos de herramientas, por identidad del solicitante, antes del ensamblado.

Limite y vigile las consultas por sesión. La filtración crece con el presupuesto de consultas. Límites de tasa, topes de sesión y detección de anomalías sobre consultas repetitivas y casi idénticas encarecen notablemente el juego de distinción.

Asuma la puntuación por modelo sustituto. Black-box no significa seguro: un sustituto open-weight más pequeño puntuó un objetivo mayor con 92,5 AUROC. Controlar el acceso a los logits o al modelo objetivo no basta.

Redacte y generalice en el momento del ensamblado. Cuando la propia pertenencia es sensible, prefiera representaciones agregadas, agrupadas o sintetizadas antes que registros literales en la ventana de contexto.

Trate las etiquetas del contexto como metadatos, no como política. Aplique las decisiones de compartición en la capa de herramientas y transporte entre agentes, no mediante una cabecera que se pide al modelo que respete.

Estado

AspectoDetalle
Fuente principalContext Inference Attacks Without Jailbreaks (arXiv:2609.01663), enviado el 31 de agosto de 2026
ClaseAtaque de inferencia / privacidad sobre el contexto oculto de un agente, sin jailbreak ni divulgación
Controles reportados como ineficacesInstrucción de no divulgación, supresión de logits, dilución del contexto
Resultados principales100 % de éxito en conjuntos pequeños; 63 % con 1.024 candidatos; 78,9 AUROC con contexto desconocido; 92,5 AUROC sustituto 14B frente a objetivo 32B; 81,8 AUROC con contexto recuperado por el agente
Trabajo convergenteEstudio de fuga literal de campos en MCP-a-A2A (arXiv:2609.01693), 1 de septiembre de 2026
NaturalezaResultado de investigación: sin CVE ni aviso de fabricante; afecta a las arquitecturas agénticas en general, no a un producto concreto

Sources