La puntuación de una salvaguarda no dice nada sobre su despliegue
Una auditoría en arXiv del 1 de septiembre de 2026 muestra que las métricas de salvaguardas son evidencia asimétrica: un ataque que funciona basta, ninguna tasa de rechazo prueba lo contrario.
¿De qué se trata?
El 1 de septiembre de 2026, Pingyu Wu, Weiming Zhang y Nenghai Yu publicaron en arXiv The Safeguard Worked. Is the LLM System Safer?. No es un artículo de ataque. Es una auditoría de cómo la literatura sobre salvaguardas informa de sus propios resultados, y llega a una conclusión incómoda para quien compra, despliega o aprueba una salvaguarda de LLM.
Las salvaguardas en producción se califican con tres cifras: tasa de rechazo, tasa de éxito de ataque (ASR) y tasa de violación de políticas. El argumento del artículo es que esas cifras responden a una pregunta local — cómo se comportó el control sobre las peticiones con las que fue probado — mientras que un despliegue necesita la respuesta a una pregunta distinta: cuánta ayuda para una tarea dañina sigue dando el servicio a un atacante que se adapta o que encuentra otra vía de entrada. Los autores releen los resultados publicados bajo ese segundo criterio, de modo que afirmaciones procedentes de familias distintas de salvaguardas (filtrado, ajuste fino de seguridad, desaprendizaje, clasificadores) puedan compararse bajo un único estándar a nivel de despliegue.
Cómo funciona
El hallazgo es sobre la evidencia, no sobre un payload. El artículo muestra que los requisitos de prueba son fuertemente asimétricos:
Afirmación Qué hace falta para establecerla
--------------------------- ------------------------------------------------
«Queda ayuda dañina en UN ataque que obtenga ayuda dañina del servicio
este despliegue.» desplegado. Basta por sí solo. Los autores
señalan que tales ataques reaparecen en el
corpus codificado.
«Queda poca ayuda NO PUEDE deducirse de las cifras de la propia
dañina.» salvaguarda. Exige evidencia separada sobre lo
que el SISTEMA CIRCUNDANTE sigue permitiendo una
vez que la salvaguarda cumple su función local.
Esa asimetría es la forma habitual de una prueba de seguridad — la presencia es barata de demostrar, la ausencia es cara — pero se ignora de forma rutinaria cuando un proveedor de salvaguardas o un artículo anuncia «ASR reducido del 62 % al 4 %». El 4 % describe la distribución de peticiones evaluada. No dice nada del atacante adaptativo, de la vía de entrada alternativa ni de la capa de acción que hay detrás del filtro.
El segundo resultado de la auditoría es el más contundente. Entre las afirmaciones que los autores codificaron en profundidad, la evidencia sobre la capacidad residual a nivel de sistema solo está respaldada o derivada en una pequeña minoría de casos, y exactamente una de ellas acota su residual delimitado. Dicho de otro modo: el campo mide el control, casi nunca el sistema. Una mejor puntuación local no es, por sí sola, una afirmación más sólida sobre el despliegue.
Un artículo complementario de septiembre de 2026 señala la misma brecha desde el ángulo de la composición. Capability-Gated Language Models: Security Composes, Utility Does Not (31 de agosto de 2026) formaliza el control de acceso por principal dentro de un mismo conjunto de pesos y constata que las restricciones se componen de forma predecible en el lado de la seguridad, pero no en el de la utilidad: perfiles de restricción inofensivos por separado pueden componerse en daño a la retención y a la fluidez, sin ninguna cota composicional. Apilar salvaguardas no es una operación gratuita, y el coste aterriza donde menos se mide.
Por qué importa
Esto replantea tres conversaciones prácticas.
Compras. La reducción de ASR que anuncia un proveedor es una afirmación sobre su conjunto de evaluación, no sobre su stack. Bajo el criterio del artículo, esa cifra no puede sostener «nuestro despliegue es seguro»; como mucho, no lo contradice. La pregunta pertinente es qué sigue permitiendo el sistema después de que la salvaguarda actúe: qué herramientas siguen siendo invocables, qué rutas de salida siguen abiertas, qué datos siguen al alcance.
Incentivos de investigación. Si la unidad publicable es una puntuación local, el esfuerzo se dirige a subir puntuaciones locales. Los autores son explícitos: la investigación sobre salvaguardas no puede detenerse ahí — una mejora debe juzgarse por si hace más seguro un sistema desplegado. Los benchmarks que nunca modelan el sistema circundante seguirán premiando trabajo que no se transfiere.
Operación. El informe 2026 del OWASP GenAI Security Project sobre el estado de la seguridad de la IA agéntica, resumido en junio de 2026, documenta la consecuencia: la inyección de prompts se mapea a seis de las diez categorías del Top 10 agéntico, y los incidentes reales se concentran en lo que el sistema permitía una vez confundido el modelo — comandos en lista blanca transportando payloads, fronteras de sandbox redefinidas por la salida del agente, modelos de permisos que fallan igual tanto si el disparador es un atacante como un error. Nada de eso aparece en una tasa de rechazo.
Defensas
El correctivo no es abandonar las salvaguardas. Es dejar de tratar sus puntuaciones como evidencia de despliegue y medir lo que realmente acota su riesgo.
-
Mida la capacidad residual, no la precisión del filtro. Defina qué podría alcanzar todavía un atacante exitoso asumiendo que la salvaguarda funcionó según lo diseñado. Esa cifra — no el ASR — es su declaración de riesgo.
-
Exija cotas residuales delimitadas a los proveedores. Pregunte qué población de ataques cubrió la evaluación, si los atacantes adaptativos entraban en el alcance y qué afirma el proveedor sobre el sistema circundante. «No acotado» es una respuesta aceptable; un ASR sin matizar presentado como afirmación de seguridad no lo es.
-
Diseñe para que un bypass sea sobrevivible. Listas blancas de salida, credenciales de vida corta y alcance estrecho, entornos de ejecución aislados y aprobación humana en acciones irreversibles reducen la capacidad residual se dispare o no el clasificador. Véase la tríada letal y la regla de dos para agentes.
-
Haga red team sobre el sistema, no sobre el clasificador. Una prueba que se detiene en «el filtro lo bloqueó» mide el control. Continúe más allá del bloqueo: ¿qué otra ruta alcanza la misma capacidad?
-
Presupueste el coste de composición. Según el resultado sobre capability gating, las restricciones apiladas se componen en seguridad pero no en utilidad. Trate la regresión de capacidad como métrica de primer orden al apilar defensas, o pagará en silencio por una protección que no puede demostrar.
-
Separe datos e instrucciones aguas arriba. El filtrado local es una capa sobre un problema arquitectónico: los modelos leen el prompt de sistema, la petición del usuario y el contenido recuperado como un único flujo de tokens. El filtrado de salida y los controles de flujo de información abordan partes distintas de ese problema y deben evaluarse por separado.
Status
| Elemento | Referencia | Fecha | Notas |
|---|---|---|---|
| The Safeguard Worked. Is the LLM System Safer? | arXiv:2609.00519 | 2026-09-01 | Auditoría de los informes sobre salvaguardas bajo un criterio de despliegue |
| Capability-Gated Language Models | arXiv:2609.00445 | 2026-08-31 | La seguridad se compone; la utilidad no tiene cota composicional |
| OWASP State of Agentic AI Security and Governance v2.01 | Resumen de Help Net Security | 2026-06-11 | La inyección de prompts cubre 6 de las 10 categorías del Top 10 agéntico |
Aquí no se divulga ninguna vulnerabilidad ni se señala a ningún producto. La conclusión es metodológica y accionable hoy mismo: la puntuación de una salvaguarda mide un control, y su riesgo vive en el sistema que la rodea. Mientras una afirmación no venga acompañada de evidencia sobre lo que ese sistema sigue permitiendo, una tasa de éxito de ataque más baja es un mejor resultado local y nada más.