Vishing con IA: persuade el guion, no el realismo de la voz clonada
Un estudio de julio de 2026 con 4.100 adultos en EE. UU. concluye que lo que determina si la víctima obedece es la capacidad de persuasión del guion, no cuán humana suena la voz sintética. Detectar al robot no protege.
¿Qué es esto?
El 15 de julio de 2026, investigadores de la Harvard Kennedy School, de la School of Engineering and Applied Sciences de Harvard y de Meta Platforms publicaron Evaluating AI Models’ Capability to Automate Voice Phishing Attacks (arXiv 2607.09970). El equipo —Fred Heiding, Claudio Mayrink Verdun, Simon Lermen, Andrew Kao, Vitor Albiero, Lauren Deason, Irina-Elena Veliche y Christine Lehane— realizó un experimento con 4.100 adultos estadounidenses, junto con entrevistas cualitativas, para medir cómo reaccionan las personas ante estafas telefónicas locutadas por seis sistemas de voz comerciales (Llama Full Duplex, Sesame, Gemini, el Advanced Voice de OpenAI, PlayAI y ElevenLabs), con personas reales como grupo de control.
El hallazgo principal resulta incómodo para el mercado de detección de deepfakes: que la víctima ceda o no ante la estafa casi no depende de lo humana que suene la voz, sino casi por completo de lo persuasivo que sea el guion. Un interlocutor puede ser identificado correctamente como sintético y aun así llevarse un código de un solo uso.
Cómo funciona
El estudio separa dos cosas que el debate de seguridad suele confundir: la detección (¿percibe el oyente que la voz es sintética?) y el cumplimiento (¿hace el oyente lo que pide quien llama?).
En detección, los participantes marcaron las voces sintéticas como tales alrededor del 70 % de las veces, lo que parece una defensa eficaz hasta que se observa el grupo de control. Esos mismos participantes también etiquetaron a personas reales como máquinas casi dos de cada tres veces. Dicho de otro modo, aquí no hay una verdadera habilidad para detectar «voces de IA»: hay una población que se ha vuelto ampliamente desconfiada de quien llama sin conocerlo. La sospecha subió; el acierto, no. La exposición previa a herramientas de IA o a asistentes de voz no produjo ninguna diferencia medible.
En cumplimiento, los investigadores puntuaron a cada interlocutor en sentimiento, persuasión, fiabilidad percibida y semejanza humana, y luego comprobaron cuáles predecían el cumplimiento. La persuasión domina con claridad: cada peldaño en la escala de persuasión se asocia a un aumento de aproximadamente 2,58 veces en las probabilidades (odds) de cumplimiento. Una vez controlados la persuasión y los demás factores, la semejanza humana —la propiedad que vende cada proveedor de clonación de voz y que persigue cada detector— no aporta prácticamente ningún poder predictivo independiente.
Una lectura resumida del resultado:
# Qué hace ceder de verdad a una víctima de vishing
Realismo de la voz (human-likeness)
Supuesto habitual: "Cuanto mejor el clon, más víctimas."
→ En el modelo, una vez controlados los demás factores,
el realismo aporta poco de forma independiente.
Persuasión del guion
Realidad: cada peldaño en la escala de persuasión
→ ~2,58x más probabilidades de cumplimiento.
Una voz juzgada sintética aún puede tener éxito.
Por qué importa
Las cifras exigen una lectura cuidadosa, y el artículo es honesto al respecto. En los cinco escenarios de estafa, alrededor del 16,5 % de los participantes dijo que obedecería o podría obedecer. El escenario del «familiar en apuros» llegó hasta el 36,1 %, pero esa cifra agrupa los «sí» firmes con los «quizás». En la variante con voz clonada, solo un 6,5 % aproximadamente dio un «sí» rotundo. Vacilar no es lo mismo que entregar el código de una tarjeta, y los informes internos que tratan a un tercio de la población como dispuesta a pagar malinterpretan lo que se midió. Dicho esto, la vacilación también beneficia al atacante: quien te mantiene en la línea consigue un segundo intento.
De ahí se derivan dos consecuencias estructurales. Primero, el reflejo del sector —comprar detección de voz sintética, entrenar al personal para «detectar al robot»— apunta a la variable equivocada. La detección ya es casi azar con los humanos, y detectar la máquina no detiene la persuasión. Segundo, el cambio real que trae la IA no es una falsificación mejor, sino la escala: elimina el idioma, la plantilla y la geografía como restricciones para desplegar guiones persuasivos en volumen. El fraude por voz ya era rentable para operaciones organizadas mucho antes de la clonación de voz; el modelo de costes del artículo (basado en un salario estadounidense) debe leerse por su dirección, no por sus decimales.
El hallazgo se inscribe en la misma línea que la investigación sobre ingeniería social textual: el modelo es un multiplicador de fuerza para una debilidad humana, no un exploit inédito. Corresponde a las secciones de «ingeniería social» y «amenazas a la identidad» de la mayoría de los informes de amenazas de 2026, más que a una vulnerabilidad concreta de producto.
Defensas
Como el cumplimiento se apoya en la persuasión y no en la fidelidad del audio, los controles que dependen de que un humano oiga la diferencia fracasarán. Las mitigaciones sólidas son procedimentales y fuera de banda.
- Verificación fuera de banda para cualquier acción sensible. Un restablecimiento de contraseña, una transferencia, un cambio de credencial o un reinicio de MFA nunca deben poder activarse solo con la llamada entrante. Exija una devolución de llamada a un número que la organización ya posea, o un segundo canal que quien llama no controle.
- La voz no es un factor de autenticación. Retire la verificación de identidad basada en reconocimiento de voz en mesas de ayuda y centros de llamadas. Trate cualquier voz —humana o sintética— como no autenticada hasta demostrarlo mediante datos que quien llama no pueda obtener por ingeniería social.
- Palabras clave familiares y de dirección. Para los patrones de «familiar en apuros» y «fraude del CEO», una frase secreta acordada de antemano derrota a una voz clonada sea cual sea su calidad. Distribúyala como lo haría con un código de recuperación.
- Reescriba el procedimiento, no la formación. Los programas de concienciación que enseñan al personal a detectar artefactos robóticos entrenan una habilidad que la gente demostrablemente no tiene. Sustituya el consejo de «detectar el fraude» por barreras procedimentales estrictas y guiones para frenar solicitudes bajo presión.
- Espere más falsos positivos en llamadas legítimas. A medida que el público desconfía de todo interlocutor desconocido, las llamadas salientes auténticas de bancos y servicios de TI se toman por falsas. Construya rutas de verificación que funcionen en ambos sentidos, para que las devoluciones de llamada legítimas sean fáciles de confirmar.
Estado
| Elemento | Referencia | Fecha | Notas |
|---|---|---|---|
| Estudio sobre vishing | arXiv 2607.09970 | 2026-07-15 | N=4.100 (encuesta + entrevistas); seis sistemas de voz + control humano |
| Detección vs. cumplimiento | ídem | 2026 | ~70 % de detección de lo sintético, pero humanos etiquetados como máquinas ~2/3 de las veces |
| Predictor clave | ídem | 2026 | persuasión ≈ 2,58x de probabilidad de cumplimiento; el realismo no predice de forma independiente |
| Rango de cumplimiento | ídem | 2026 | ~16,5 % total (sí/quizás); hasta 36,1 % «familiar en apuros»; ~6,5 % de «sí» firmes en el escenario clonado |
El artículo es un resultado de investigación, no una vulnerabilidad divulgada contra un producto concreto. Su mensaje operativo es estable en cualquier arquitectura: si su postura anti-vishing depende de que alguien note que la voz es sintética, está defendiendo la variable equivocada. Mueva el control hacia la verificación fuera de banda y el procedimiento.