sistema: OPERATIVO
← volver a todos los hacks
JAILBREAK MEDIUM NEW

Cebado contextual: burlar la seguridad de un LLM falsificando la conversación previa

Una clase de jailbreak que nunca formula la pregunta prohibida de forma directa. Fabrica los turnos anteriores del diálogo para que el modelo trate una continuación peligrosa como el paso natural.

2026-07-20 // 7 min affects: gpt-5, gpt-4o-mini, gemini-3-flash, claude-opus-4-7, claude-sonnet-4-6, llama-3.1-70b, qwen3-8b, gpt-oss-120b

¿Qué es esto?

La mayor parte de la investigación sobre jailbreaks se centra en el prompt: el mensaje único que envía el atacante. El cebado contextual (contextual priming) ataca otra superficie: el historial de conversación que el modelo cree estar continuando. En lugar de plantear una pregunta peligrosa y disfrazarla, el atacante fabrica los turnos anteriores del diálogo —incluidas respuestas atribuidas al propio asistente— de modo que, cuando llega la petición real, el modelo ya ha sido dirigido hacia un registro complaciente.

La versión canónica de esta clase es Response Attack (RA), presentada por Miao et al. en un artículo publicado en julio de 2025 (arXiv 2507.05248) y luego aceptado en AAAI 2026. RA formaliza el cebado contextual como mecanismo de ataque y reporta tasas de éxito sistemáticamente superiores a nueve métodos de referencia. Un trabajo de 2026, ContextualJailbreak (arXiv 2605.02647), automatiza la idea y la mide contra los modelos de frontera actuales, razón por la cual esta clase merece tratarse hoy y no archivarse como historia de 2025.

Cómo funciona

El mecanismo explota una asimetría que los autores de RA enuncian con claridad: la alineación de seguridad tiende a ser más robusta ante una consulta dañina que ante contenido dañino que llega desde el contexto previo. Un modelo que rechaza sin más «explica cómo hacer X» puede continuar sin problema si su contexto ya contiene una respuesta a medio redactar sobre X que parece ser su propio trabajo anterior.

Response Attack construye ese contexto de forma deliberada. Un modelo auxiliar genera una respuesta levemente dañina a una versión parafraseada del objetivo —nada que active un filtro por sí solo—. Esa respuesta intermedia se inserta en la transcripción como un turno anterior del asistente y solo entonces se envía un disparador breve para provocar la escalada. El modelo lee una conversación en la que, aparentemente, ya accedió a ayudar.

Transcripción falsificada enviada en una sola solicitud
-------------------------------------------------------
system:     [encuadre de apariencia ordinaria]
user:       [versión parafraseada y suavizada del objetivo]
assistant:  [respuesta parcial levemente dañina — el CEBO,
             atribuida al modelo pero escrita por el atacante]
user:       [disparador breve: «continúa» / «añade los pasos»]
              → el modelo escala desde su propia base aparente

ContextualJailbreak lleva la idea de una plantilla fija a una búsqueda. Ejecuta un bucle evolutivo sobre todo el diálogo simulado, mutando la conversación cebada con operadores semánticos (juego de rol, escenario, expansión y dos que los autores introducen) y puntuando cada intento con un juez de nocividad graduado de 0 a 5, de modo que los éxitos parciales orientan la siguiente generación en vez de descartarse. Todo el diálogo multiturno falsificado se sigue entregando en una sola llamada a la API. Aquí no se reproduce ningún payload: lo relevante es estructural, el atacante controla el historial y el historial se considera fiable.

Por qué importa

Las cifras muestran que no es un juguete. ContextualJailbreak reporta tasas de éxito (contenido dañino obtenido) que alcanzan el 100 % en varios modelos de pesos abiertos —entre ellos qwen3-8b y llama-3.1-70b— y el 90 % en un modelo abierto mayor, muy por encima de las referencias de uno y varios turnos. Los diálogos adversarios optimizados contra un modelo abierto se transfieren tal cual a sistemas de frontera alojados: el artículo reporta alrededor de un 90 % de éxito contra gpt-4o-mini y en torno al 70 % contra gpt-5 y gemini-3-flash en el umbral «dañino».

Dos lecciones trascienden cualquier benchmark concreto. Primera: el filtrado a nivel de prompt es la capa equivocada. Un clasificador que inspecciona el último mensaje del usuario ve un anodino «continúa»; la nocividad reside en el historial fabricado que lo rodea. Segunda: los resultados dependen fuertemente de la receta de alineación y están ligados a la versión. El mismo estudio halló que los dos modelos Claude probados —claude-opus-4-7 y claude-sonnet-4-6— eran mucho más resistentes, rechazando de entrada la mayoría de los ataques transferidos (éxito en torno al 15 % frente al 70–90 % en otros modelos). Es una propiedad de una pila de alineación endurecida concreta en una versión concreta, no de los modelos de frontera en general, y es justo el tipo de divergencia que conviene medir en lugar de presuponer.

Defensas

Como el ataque reside en la estructura de la conversación, las defensas deben razonar sobre la trayectoria, no sobre el último mensaje.

  1. No confíe en el historial suministrado por el cliente como si lo hubiera escrito el modelo. En despliegues por API, los turnos del asistente son manipulables por el atacante. Si su producto permite enviar una transcripción completa, trate los turnos «assistant» anteriores como entradas no fiables, no como compromisos establecidos del modelo.
  2. Pase de una alineación a nivel de prompt a una alineación sensible al contexto. La recomendación central de los autores de RA es que la seguridad debe sostenerse sobre un contexto conversacional en evolución, no solo sobre la consulta final. Evalúe los rechazos condicionados a historiales adversarios, no solo a prompts aislados.
  3. Reanalice todo el contexto en el momento de la generación. Aplique los controles de salida y de seguridad al diálogo completo ensamblado —cebos inyectados incluidos— y no solo al último turno. Un «continúa» que sigue a una respuesta parcial dañina debe puntuarse por lo que prolonga.
  4. Haga red teaming con historiales cebados. Añada escenarios de turno anterior falsificado (cebo leve y luego escalada) a su conjunto de evaluación. Ambos artículos publican código o ejemplos sintéticos precisamente para este tipo de prueba defensiva.
  5. Prefiera pilas de alineación que se muestren resistentes al cebado contextual y luego verifique en su propia pila y versión. La robustez demostrada para la versión de un proveedor no es trasladable; vuelva a probar tras cada cambio de modelo o de prompt de sistema.

Estado

ElementoReferenciaFechaNotas
Response Attack (base)Miao et al., arXiv 2507.052482025-07Formaliza el cebado contextual; supera 9 referencias; código publicado
Response Attack (publicación)Actas de AAAI 20262026Aceptación por pares
ContextualJailbreak (automatización)Rodríguez Béjar et al., arXiv 2605.026472026Búsqueda evolutiva sobre diálogo cebado; resultados de transferencia a frontera
Impacto en pesos abiertosContextualJailbreak2026Hasta 100 % de éxito (contenido dañino) en varios modelos abiertos
Transferencia a fronteraContextualJailbreak2026~70–90 % en gpt-4o-mini / gpt-5 / gemini-3-flash; en torno al 15 % en los modelos Claude probados

La conclusión duradera: el rechazo de un modelo solo vale lo que vale su contexto aparente más comprometedor. Si un atacante puede escribir el historial, el último mensaje apenas cuenta, así que la defensa debe situarse donde se ensambla el historial, no donde se formula la pregunta.

Sources