sistema: OPERATIVO
← volver a todos los hacks
GOVERNANCE LOW NEW

AI Safety Index verano 2026: nueve labs evaluados en seguridad y riesgo

El índice de julio de 2026 del Future of Life Institute califica a nueve labs de frontera en 37 indicadores de seguridad. Ninguno supera el C+, y los marcos de seguridad carecen de firmeza.

2026-07-21 // 7 min affects: anthropic-claude, openai-gpt, google-gemini, meta-llama, xai-grok, mistral, deepseek, alibaba-qwen, zhipu-glm

What is this?

El 7 de julio de 2026, el Future of Life Institute (FLI) publicó el AI Safety Index — Summer 2026 Edition, la cuarta entrega de una serie que califica a las empresas de IA de frontera por sus prácticas de seguridad. No es un informe de vulnerabilidades, sino un boletín de calificaciones: un panel independiente de siete investigadores y expertos en gobernanza asigna notas a nueve grandes labs —Anthropic, OpenAI, Google DeepMind, Meta, xAI, Mistral, DeepSeek, Alibaba Cloud y Z.ai— sobre 37 indicadores agrupados en seis dominios.

La conclusión principal es que nadie sale bien parado. El informe completo, fechado el 14 de julio, sitúa a Anthropic en cabeza con un C+ (2,66 sobre una escala GPA de 4,0), a OpenAI con C (2,28) y a Google DeepMind con C (2,01). Meta obtiene un D+, los dos labs chinos con nota publicada (Z.ai y Alibaba Cloud) un D-, mientras que xAI, DeepSeek y Mistral reciben calificaciones reprobatorias. La evidencia se recopiló hasta el 3 de junio de 2026, de modo que las notas reflejan la situación de mediados de 2026, no una instantánea en tiempo real.

How the index scores labs

Los seis dominios son evaluación de riesgos (Risk Assessment), daños actuales (Current Harms), marcos de seguridad (Safety Frameworks), seguridad existencial (Existential Safety), gobernanza y rendición de cuentas (Governance & Accountability) e intercambio de información (Information Sharing). Para un lector de seguridad, los indicadores interesantes son concretos y no meramente aspiracionales: programas de bug bounty para vulnerabilidades del sistema, pruebas de seguridad externas antes del despliegue, revisión independiente de las evaluaciones, evaluaciones de capacidades peligrosas con elicitación, protección de las salvaguardas frente al fine-tuning, respuesta a incidentes graves, privacidad del usuario y notificación de incidentes serios a las autoridades. Son exactamente los controles que exigiría un programa maduro de seguridad de proveedores.

La metodología importa si se quiere citar el índice. El panel revisó materiales públicos —tarjetas de modelo, artículos de investigación, resultados de benchmarks— complementados con una encuesta dirigida a los vacíos de transparencia, como la protección de denunciantes y la evaluación externa. Los revisores asignaron notas por dominio según estándares absolutos, justificaron sus decisiones y luego se promediaron las puntuaciones; las notas individuales permanecen confidenciales. Es un juicio de expertos, no un benchmark automatizado: el valor está en el razonamiento y las recomendaciones, no en una sola cifra.

Anthropic lidera cinco de los seis dominios, sobre todo por su transparencia (publica tanto las especificaciones del modelo como los prompts de sistema) y un marco de seguridad relativamente desarrollado; OpenAI encabeza ahora la evaluación de riesgos gracias a pruebas externas más amplias. El dominio más débil de toda la industria es la seguridad existencial, donde ninguna empresa supera el C- y la mayoría se queda en D o por debajo.

Why it matters

Dos hallazgos deberían preocupar a quien dependa de estos sistemas. Primero, el panel considera que los marcos de seguridad carecen de firmeza: incluso los labs que publicaron o actualizaron un marco al acercarse los plazos europeos y estadounidenses suelen carecer de umbrales cuantitativos, de auditorías realmente independientes y de una autoridad interna claramente facultada para detener un despliegue. Segundo, varios actores de primer nivel han dado marcha atrás en sus compromisos de pausa ante el acercamiento a líneas rojas de capacidad, un patrón que los revisores llaman «mover la portería» y que ha «socavado los marcos de seguridad en todo el sector».

Para los defensores, el índice es útil precisamente porque es neutral respecto a los proveedores y está argumentado. Ofrece a los equipos de seguridad y compras una referencia externa para rebatir los argumentos de marketing, y nombra la brecha entre el discurso y el comportamiento real: el informe señala que la comunicación tranquilizadora de varios labs diverge de su conducta comercial y de sus posiciones legislativas. Como lo resume un miembro del panel, Stuart Russell, las empresas planean cada vez más «desplegar [sistemas] incluso cuando es demostrablemente inseguro hacerlo».

Defenses

El uso concreto de un informe así es alimentar la evaluación del riesgo de proveedores. La idea rectora: confiar en la evidencia, no en la promesa.

  • Vincule los dominios con sus propios controles. Trate la evaluación de riesgos y el intercambio de información como indicadores indirectos de la madurez del red teaming y de la transparencia sobre incidentes, y pondérelos según su caso de uso.
  • Exija lo que el índice señala como ausente. Solicite umbrales de capacidad cuantitativos, auditores independientes con nombre y la identidad del órgano interno facultado para detener un lanzamiento, no solo un documento marco.
  • Verifique la durabilidad de las salvaguardas. Confirme cómo un proveedor protege sus salvaguardas frente al fine-tuning y al abuso de la API, uno de los indicadores explícitos del índice.
  • Compruebe los canales de incidentes y divulgación. Exija un compromiso de notificación de incidentes graves y un canal operativo de bug bounty o de divulgación antes de integrar un modelo en flujos sensibles.
  • Revise en cada edición. Las notas cambian (Meta sube, xAI baja); use la tendencia, no una única instantánea, y revalúe en cada renovación.

Status

AspectoDetalle
EditorFuture of Life Institute (FLI)
Publicación7 de julio de 2026 (informe completo fechado el 14 de julio)
Alcance9 labs, 37 indicadores, 6 dominios
Corte de evidencia3 de junio de 2026
Mejor notaAnthropic — C+ (2,66 / 4,0)
Notas reprobatoriasxAI, DeepSeek, Mistral
TipoEvaluación de seguridad independiente, no un aviso de vulnerabilidad

La conclusión no es un nuevo ataque, sino un problema de medición hecho explícito: los compromisos de seguridad que las propias empresas se fijan son, según la lectura del panel, un indicador poco fiable de la seguridad real. El índice ofrece a compradores y defensores una forma estructurada y con fuentes de interrogar esa brecha antes de depender de un modelo.

Sources