sistema: OPERATIVO
← volver a todos los hacks
DEFENSE MEDIUM NEW

Detectores de inyección de prompt que lucen en un benchmark pueden fallar casi todo en su agente

Un estudio de arXiv del 2 de octubre de 2026 con quince detectores muestra que los rankings no se transfieren a las salidas de herramientas: 95,1 % en BIPIA, 2,1 % en AgentDojo.

2026-10-06 // 6 min affects: prompt-injection-detectors, prompt-guard, protectai-deberta, llm-agents

¿Qué es?

Los detectores de inyección de prompt son pequeños clasificadores situados entre un agente y el contenido que lee: páginas web, correos, resultados de herramientas. Señalan los textos que intentan dar nuevas instrucciones al agente. Los proveedores suelen respaldarlos con una puntuación en un benchmark público. Un preprint enviado a arXiv el 2 de octubre de 2026 (arXiv:2610.03448, «Passing the Test You Trained On», autor único Zhuowen Liu) plantea una pregunta práctica: ¿predice esa puntuación el comportamiento del detector dentro de un agente?

La respuesta es, en gran medida, que no. El estudio evalúa quince detectores y dos jueces LLM, y concluye que los rankings en un benchmark centrado en texto (BIPIA, publicado en diciembre de 2023) dicen muy poco sobre el rendimiento con salidas de herramientas de agentes (AgentDojo, junio de 2024, y tau-bench).

Cómo funciona

Los autores reproducen las mismas llamadas a herramientas en un entorno limpio y en uno inyectado. Comparar ambas salidas, método que llaman «differential replay», permite etiquetar qué salidas contienen realmente la inyección, sin depender de búsquedas de subcadenas frágiles cuando los resultados se reserializan en YAML o JSON.

Después miden la detección con una tasa de falsos positivos fija del 1 % en tres conjuntos: AgentDojo v1.2 (339 salidas limpias y 1.152 inyectadas), tau-bench (1.533 limpias y 584 inyectadas) y BIPIA (1.200 benignas y 2.435 inyectadas).

Las diferencias son grandes. Un detector captura el 95,1 % de las inyecciones de BIPIA pero solo el 2,1 % de las de AgentDojo. Otro captura el 72,2 % en AgentDojo pero el 15,2 % en tau-bench. La correlación de rangos entre BIPIA y AgentDojo es prácticamente nula (tau de Kendall 0,01); entre los dos benchmarks de agentes es débil (0,28). Los falsos positivos, en cambio, son estables entre benchmarks de agentes (tau 0,67) y muy variables: del 0 % a más del 90 % de las salidas benignas marcadas, según el detector.

El mejor detector en los benchmarks de agentes se entrenó con entradas de estilo agente y no compartía datos con los benchmarks evaluados, lo que apunta a la distribución de los datos de entrenamiento, más que a la posición en un ranking.

Por qué importa

Un detector ajustado con inyecciones breves en lenguaje natural puede parecer excelente y, aun así, pasar por alto inyecciones incrustadas en salidas estructuradas. A la inversa, uno que marca gran parte de los resultados JSON normales rompe los flujos de trabajo y acaba desactivado. Ambos fallos son invisibles si solo se mira una cifra global de precisión.

Los autores señalan límites: entornos simulados, ataques estáticos de benchmarks públicos, detección probablemente menor frente a atacantes adaptativos y datos de entrenamiento auditables solo en dos detectores. Las cifras son una advertencia metodológica, no un ranking de productos.

Defensas

Evalúe los detectores con las salidas reales de herramientas de su agente, no con texto genérico. Reporte la detección con una tasa de falsos positivos baja y fija (por ejemplo, 1 %) y mida aparte los falsos positivos sobre salidas benignas de sus herramientas, porque esa cifra sí se transfiere. Compruebe si el detector se entrenó con el benchmark con el que se promociona. Prefiera detectores entrenados con entradas de estilo agente y repita las pruebas cada vez que cambie el formato de las herramientas.

No convierta un detector en su único control. Combínelo con límites de arquitectura: mínimo privilegio para las herramientas, confirmación humana en acciones de alto impacto, separación entre contenido no confiable e instrucciones y registro de las llamadas a herramientas.

Status

ElementoDetalle
PublicaciónarXiv:2610.03448, enviada el 2 de octubre de 2026
Alcance15 detectores + 2 jueces LLM; AgentDojo, tau-bench, BIPIA
Resultado clave95,1 % en BIPIA frente a 2,1 % en AgentDojo para el mismo detector (1 % FPR)
LimitacionesEntornos simulados, ataques estáticos, auditoría parcial de datos de entrenamiento
Estado de la correcciónGuía metodológica; sin parche de producto

Sources