sistema: OPERATIVO
← volver a todos los hacks
RESEARCH MEDIUM NEW

Cuatro formas de ofuscar una matriz de pesos, una cosa que todas dejan atrás

Un artículo de CCS del 9 de septiembre de 2026 muestra que las técnicas de permutación, escalado y enmascaramiento usadas para delegar capas LLM a una GPU no confiable preservan todas la dirección de las columnas.

2026-09-18 // 9 min affects: bert-base, vit-base, qwen2.5-0.5b, qwen2.5-1.5b, tee-shielded-inference

¿De qué se trata?

El 9 de septiembre de 2026, seis investigadores de la Universidad Tsinghua publicaron un artículo — Hanyi Zhou, Chenyang Li, Yuanzhe Pang, Ke Xu, Mingwei Xu y Zhuotao Liu, aceptado en ACM CCS 2026 (Ciclo B) — que hace algo que la literatura sobre protección de modelos en dispositivo no había hecho: deja de atacar estos esquemas uno por uno y pregunta qué tienen en común.

El objetivo es un patrón de diseño llamado TEE-Shielded LLM Partition (TSLP). Se quiere ejecutar un modelo propietario en el dispositivo de un usuario sin entregarle los pesos. Un entorno de ejecución confiable — Intel SGX, Arm TrustZone — actúa como ancla de confianza, pero es demasiado lento para ejecutar un transformer. Así que se ofuscan las capas lineales costosas, se delegan a la GPU no confiable del dispositivo y solo se retienen en el enclave las operaciones baratas. La GPU ve una matriz de pesos revuelta y calcula con ella; el enclave restaura el resultado.

El hallazgo del artículo es que los esquemas de revoltura publicados hasta ahora son cuatro técnicas en distintas combinaciones, que esas cuatro técnicas son cerradas bajo composición, y que toda composición de ellas preserva la única propiedad que un atacante realmente necesita. Los autores llaman a su ataque Collapse y reportan que rompe tres esquemas de conferencias de primer nivel a la vez: ArrowCloak (USENIX Security’25), TSQP (IEEE S&P’25) y LoRO (NeurIPS’25).

Cómo funciona

Empecemos por el modelo de amenaza, porque es inusual y en él reside toda la razón de la relevancia de este trabajo. El adversario aquí es el propietario del dispositivo. Controla el host no confiable y la GPU. No puede romper el TEE — los canales laterales de hardware y los ataques de ejecución transitoria quedan explícitamente fuera del alcance — y sigue el protocolo correctamente. El artículo lo describe como honest-but-curious: el atacante simplemente registra cada tensor que cruza la frontera del enclave y guarda los registros.

Esto importa porque los esquemas TSLP se defienden mediante rotación de claves. El enclave renueva sus claves de ofuscación cada pocas rondas, bajo la teoría de que ninguna clave queda expuesta lo suficiente para acumular observaciones útiles. El ataque acepta esa premisa y trabaja a partir de T vistas ofuscadas distintas de la misma matriz, más dos elementos de contexto: el modelo preentrenado público del que se ajustó el modelo víctima, recuperado mediante técnicas estándar de huella de modelo, y menos del 1 % del conjunto de entrenamiento original en datos de tarea etiquetados, obtenidos consultando el modelo desplegado.

Y el objetivo no es la recuperación exacta de los pesos. Es un modelo sustituto:

  entradas del atacante                  salida del atacante
  ─────────────────────                  ───────────────────
  modelo público  M_pre          ┐
  T vistas ofuscadas  W̃_1..W̃_T   ├──► sustituto  M_sur
  ≤1% de datos etiquetados       ┘      (misma arquitectura,
                                         rendimiento comparable)

  criterio de éxito:  Acc(M_sur) ≥ Acc(M_vic) − δ,   δ = 0.05

Cinco puntos porcentuales. Si el modelo robado queda a menos de cinco puntos del original en el conjunto de evaluación, la defensa falló.

La contribución formal es la definición de una primitiva de ofuscación como un par de operadores (O, ℛ) donde el enclave publica W̃ = O(W) y reconstruye ℛ(X·W̃) = XW. Una primitiva es válida solo si satisface tres propiedades de forma simultánea: corrección (equivalencia funcional exacta), eficiencia (C(O) + C(ℛ) ≪ C(XW), de lo contrario delegar no tiene sentido) y resistencia a la extracción de modelo bajo los presupuestos de observación y datos anteriores.

La cláusula de eficiencia es la trampa. Una máscara aditiva gaussiana densa e i.i.d. sería realmente segura — pero calcular el término de corrección dentro del enclave cuesta lo mismo que calcular allí la capa completa, lo que el artículo califica de «autodestructivo». Por tanto, todo esquema de la literatura es alguna transformación estructurada y barata, y la estructura es precisamente de lo que se alimenta Collapse. Las cuatro primitivas existentes:

CategoríaPrimitivaEfecto
Multiplicativapermutación Πreordena las columnas
Multiplicativaescalado Dreescala las columnas
Aditivamáscara dispersa Sperturba una fracción pequeña de los elementos
Aditivamáscara de rango bajo Loculta la matriz en un subespacio de baja dimensión

Los autores demuestran que estas primitivas se componen sin degradar ninguna de las tres propiedades: la corrección sigue siendo exacta y el coste en el enclave crece solo de forma aditiva. Apilar es lo que hace ArrowCloak. La forma canónica de todas esas composiciones, que llaman O_prior, constituye por tanto la frontera estructural de toda la familia. No de un esquema. De la familia.

Luego viene la observación central, expresada sin rodeos: las direcciones de las columnas de la matriz de pesos protegida no pueden enmascararse eficazmente mediante ninguna composición de estas primitivas. La permutación y el escalado solo reordenan y reescalan columnas, de modo que las direcciones sobreviven y siguen correlacionadas con el modelo público. Una máscara dispersa toca demasiados pocos elementos para desplazarlas. Una máscara de rango bajo oculta la matriz en un único subespacio de baja dimensión — y deja las direcciones intactas en el complemento ortogonal.

Collapse procede entonces en tres etapas, descritas aquí al nivel en que el artículo las plantea y no más abajo: alinear las permutaciones entre las múltiples vistas observadas; combinar las vistas alineadas para recuperar la máscara de rango bajo y localizar el soporte de la máscara dispersa, produciendo un modelo intermedio; ajustar ese modelo intermedio sobre el pequeño conjunto etiquetado para eliminar la máscara dispersa residual y el escalado. El resultado es un sustituto con la arquitectura de la víctima y rendimiento comparable, evaluado en cuatro modelos: BERT-Base, ViT-Base, Qwen2.5-0.5B y Qwen2.5-1.5B.

Por qué importa

La lectura estrecha es que tres esquemas concretos deben revisarse. La lectura útil trata de cómo se ha evaluado esta clase de defensa.

Los ataques previos contra TSLP eran específicos de cada esquema: ArrowMatch apuntaba a construcciones de permutación y escalado, y otra línea de trabajo apuntaba al enmascaramiento aditivo. Cada uno rompía un diseño, y cada uno invitaba a la respuesta natural: apilar más técnicas, acelerar la rotación de claves, publicar la composición. Es exactamente esa respuesta la que este artículo cierra. Si las primitivas son cerradas bajo composición y toda composición preserva la dirección de las columnas, entonces apilar no es un argumento de seguridad. Es un argumento de rendimiento disfrazado. Ya hemos escrito sobre cómo las defensas de agentes no se componen; este es el mismo fallo en una capa muy distinta de la pila, y aquí queda demostrado en lugar de medido.

Lo segundo que conviene interiorizar es el presupuesto. Un atacante que posee el dispositivo, no puede romper el enclave y dispone de menos del 1 % de los datos de entrenamiento no es un adversario exótico: es la condición de despliegue normal para cualquier proveedor que distribuya un modelo propietario ajustado en hardware de consumo. La rotación de claves, el recurso estándar del campo, es precisamente lo que suministra las múltiples vistas que el ataque consume. El mecanismo de higiene de la defensa es una entrada del ataque.

Tercero: la palanca del atacante proviene del modelo preentrenado público. Lo que se protege es la diferencia entre un modelo público y uno ajustado en privado, y la mitad pública es gratuita. Identificar el modelo base por huella es un problema resuelto. Es la misma asimetría que convierte la detección de extracción de modelos en un área de investigación activa y no en una cuestión cerrada.

Para situar el tema en un marco más amplio, la sistematización del conocimiento sobre seguridad de la IA en dispositivos móviles publicada el 1 de julio de 2026 por Yujin Huang, Xin Zheng, Xingliang Yuan y Kwok-Yan Lam cubre el panorama de ataques y defensas para modelos desplegados localmente, así como sus lagunas. El almacenamiento local de un modelo es la condición raíz; TSLP es un intento de convivir con ella, y la computación confidencial para cargas agénticas es otro.

Defensas

No trate la composición como un multiplicador de seguridad. Si su esquema de protección es una pila de permutación de columnas, escalado de columnas, enmascaramiento disperso y enmascaramiento de rango bajo, añadir una quinta combinación de las mismas cuatro primitivas no lo saca de O_prior. Pregúntese qué invariante destruye su construcción, no cuántas capas tiene.

Pregunte qué sobrevive a la rotación de claves, no qué oculta una sola clave. La pregunta de seguridad relevante para un despliegue TSLP es qué aprende un adversario de T vistas, no de una. Si su modelo de amenaza supone una exposición estática única, no describe su despliegue.

Rompa la estructura por filas y columnas, no solo el orden. La extensión propuesta por los autores, O_ext, añade dos primitivas dirigidas precisamente a ese punto: una primitiva multiplicativa dispersa que mezcla columnas en lugar de solo permutarlas, y una primitiva multiplicativa bilateral que perturba filas y columnas conjuntamente. Los autores reportan que esto reduce en promedio el rendimiento del sustituto a la referencia empírica de caja negra — y precisan explícitamente, dos veces, que no reivindican seguridad universal para la extensión, al haberla evaluado solo contra el pipeline Collapse existente. Considérela una mejor familia de primitivas, no una solución.

Presupueste el sustituto, no los pesos. Una diferencia de cinco puntos porcentuales es aquí la definición práctica del robo. Un esquema de protección medido por el error de reconstrucción de pesos puede parecer excelente y fallar por completo esta prueba. Evalúe con el rendimiento posterior de un sustituto entrenado por el atacante.

Reduzca la diferencia con el modelo público si la propiedad intelectual está en el ajuste. Cuanto más estrecha sea la brecha entre el modelo público y el desplegado, menos tendrá que recuperar el atacante. Donde eso sea inaceptable, la conclusión honesta puede ser que los pesos no deberían estar en el dispositivo en absoluto, lo que orienta hacia la inferencia en servidor o hacia hardware donde la confidencialidad se aplica en lugar de ofuscarse.

No lo lea como un veredicto sobre los TEE. El ataque no compromete el enclave. Ataca el atajo de delegación adoptado para hacer el enclave suficientemente rápido. Las GPU de computación confidencial — el artículo menciona H100 CC y TDX-IO — se presentan como complementarias y no superadas, y los canales laterales de enclave, tratados por separado en la literatura sobre canales laterales de inferencia, siguen siendo un problema distinto.

Estado

ElementoDetalle
PublicaciónarXiv:2609.10117v1 [cs.CR], enviado el 9 de septiembre de 2026; 17 páginas
ConferenciaAceptado en ACM CCS 2026 (Ciclo B)
AutoresHanyi Zhou, Chenyang Li, Yuanzhe Pang, Ke Xu, Mingwei Xu, Zhuotao Liu (Universidad Tsinghua)
AtaqueCollapse — extracción de sustituto guiada por primitivas contra ofuscación compuesta de pesos
AdversarioPropietario del dispositivo, honest-but-curious; controla el host y la GPU; no puede comprometer el TEE
PresupuestosT vistas ofuscadas a lo largo de las rotaciones de clave; menos del 1 % del conjunto de entrenamiento original, etiquetado
Umbral de éxitoSustituto a menos de δ = 0.05 (cinco puntos porcentuales) del rendimiento de la víctima
Esquemas rotosArrowCloak (USENIX Security’25), TSQP (IEEE S&P’25), LoRO (NeurIPS’25)
Modelos evaluadosBERT-Base, ViT-Base, Qwen2.5-0.5B, Qwen2.5-1.5B
Extensión propuestaO_ext — añade las primitivas multiplicativa dispersa y multiplicativa bilateral
Límites de alcanceCanales laterales de hardware y ejecución transitoria fuera de alcance; no se reivindica seguridad universal para O_ext
ContextoSoK sobre seguridad de IA en dispositivos móviles, arXiv:2607.00362, 1 de julio de 2026

Sources