El fraude de 25 millones por videollamada deepfake en Hong Kong

En este artículo

  1. El caso concreto, lo que sabemos
  2. La técnica subyacente, sin alarmismo
  3. El cambio en el modelo de fraude del CEO
  4. Lo que funciona y lo que no funciona como defensa
  5. Las consecuencias que aún no estamos digiriendo
  6. La cuestión política

Definiciones · Referencias · Para profundizar · También te interesa · En otros sitios

Hoy hablamos del caso que mejor demuestra el cambio cualitativo que la inteligencia artificial generativa introduce en el fraude corporativo. Febrero de 2024, oficina de Hong Kong de Arup —una multinacional británica de ingeniería con presencia global—. Un empleado del departamento financiero participa en una videollamada con su director financiero y otros cinco directivos. Reconoce las caras. Reconoce las voces. La videollamada parece rutina. Transfiere veinticinco millones de dólares a cinco cuentas distintas. Días después descubre que ninguno de los directivos estaba realmente en la llamada. Todos eran deepfakes en tiempo real. ¿Por qué importa? Porque la videollamada deja de ser evidencia confiable de quién habla con uno. Mi opinión está sesgada porque trabajo en una empresa donde las videollamadas son rutina y el cambio operativo es brutal. Forma la tuya.

Llevo el caso Arup metido en la cabeza desde que se hizo público en febrero de 2024. Es probablemente el ejemplo más limpio de un cambio de paradigma que no estamos digiriendo con la velocidad suficiente. La videollamada acaba de dejar de ser, sin que la sociedad lo haya procesado, una forma fiable de saber con quién está uno hablando.

El caso concreto, lo que sabemos

Arup es una empresa británica de ingeniería y consultoría fundada en 1946 por Ove Arup. Tiene unos 18.500 empleados, oficinas en más de treinta países, y participa en proyectos icónicos: la Ópera de Sídney, la Pompidou, el Centro Acuático de Pekín, la cobertura del Bird's Nest. Es referente sectorial y su presencia pública —presentaciones, conferencias, vídeos corporativos— es alta.

El caso se hizo público a principios de febrero de 2024 cuando la Policía de Hong Kong informó a South China Morning Post y a otros medios sobre un fraude masivo perpetrado contra la oficina hongkonesa de la empresa. La cronología, según los detalles confirmados por la policía y por la propia Arup en sus declaraciones públicas posteriores, es la siguiente.

Mediados de enero de 2024. Un empleado del departamento financiero de la oficina de Hong Kong recibe un correo electrónico aparentemente firmado por el CFO de la empresa —ciudadano británico, normalmente con base en otra oficina— solicitando una transferencia confidencial urgente. El empleado, formado en protocolos de ciberseguridad, sospecha. Las transferencias confidenciales urgentes son uno de los patrones clásicos del fraude del CEO.

Al día siguiente, le convocan a una videollamada con el CFO y otros cinco directivos para revisar el asunto. La videollamada se produce. El empleado ve y oye a las personas que conoce. Las caras son las correctas. Las voces son las correctas. El estilo de hablar, el acento, los modos —en lo que el empleado puede juzgar en una videollamada— son consistentes con los originales. La videollamada disipa sus sospechas iniciales.

El empleado procede con la transferencia. Veinticinco millones de dólares estadounidenses, en quince transferencias a cinco cuentas bancarias distintas en Hong Kong, según los detalles de la policía. Las cuentas se vacían rápidamente a otras jurisdicciones antes de que el fraude se detecte.

La detección se produce, según las versiones públicas, varios días después, cuando el empleado contacta con la sede de la empresa por otra cuestión y descubre que el CFO real no había mantenido ninguna videollamada con él. Ninguno de los cinco directivos había participado en la llamada. Eran cinco deepfakes en tiempo real generados a partir de material audiovisual público de los directivos —presentaciones grabadas, entrevistas, vídeos corporativos disponibles en YouTube, LinkedIn y otras fuentes públicas—.

La técnica subyacente, sin alarmismo

Conviene entender la técnica sin convertirla en arma de pánico, porque la sobriedad técnica es lo que permite construir defensas operativas.

Generar un deepfake de vídeo en tiempo real a partir de una persona conocida con presencia pública moderada requiere tres componentes técnicos. Primero, un modelo de generación de cara y expresión facial entrenado con material de la persona objetivo. Segundo, un modelo de clonación de voz entrenado con audio de la misma persona —para voz de calidad razonable basta con unos minutos de audio limpio—. Tercero, un sistema que sincronice ambos en tiempo real durante la videollamada, traduciendo los movimientos faciales y la voz del operador real en los movimientos faciales y la voz del personaje suplantado.

En 2020, lograr esto con calidad suficiente para engañar a un observador atento durante varios minutos requería meses de trabajo de un equipo técnico cualificado, hardware especializado, y datos de entrenamiento abundantes. En 2024, varias combinaciones de tecnologías comerciales —algunas legales, otras en zonas grises— permiten lograrlo en cuestión de horas con hardware de consumo. Modelos como SadTalker, Wav2Lip, y servicios comerciales como HeyGen, D-ID, Synthesia (para usos legítimos) y sus equivalentes en zonas no reguladas (para usos ilegítimos), han bajado dramáticamente el coste técnico.

La materia prima necesaria —vídeo y audio de la persona objetivo— está, en el caso de directivos corporativos con presencia pública, ampliamente disponible. Una presentación corporativa de quince minutos en YouTube, dos entrevistas en LinkedIn, alguna conferencia grabada. Con eso se entrenan modelos suficientes para una suplantación operativa de varios minutos en videollamada.

Esto significa que el perfil de víctimas potenciales se ha ensanchado dramáticamente. Hasta 2022, este tipo de fraude estaba limitado a personas con altísima visibilidad pública —jefes de Estado, CEOs de empresas cotizadas de gran tamaño—. Hoy, cualquier directivo con presencia moderada en LinkedIn y en vídeos corporativos es objetivo viable.

El cambio en el modelo de fraude del CEO

El fraude del CEO o BEC (Business Email Compromise) lleva décadas siendo una de las modalidades más rentables del fraude corporativo. Su mecánica clásica era textual: correos electrónicos cuidadosamente preparados que suplantaban al CEO o al CFO, pidiendo transferencias urgentes. Las empresas con buena formación en ciberseguridad aprendieron a defenderse exigiendo confirmación por canal alternativo —llamada de voz al directivo, mensaje por canal corporativo verificado—.

La verificación por canal de voz funcionaba razonablemente bien hasta 2022. La clonación de voz era posible pero costosa y la calidad permitía detectar la suplantación con un poco de atención. A partir de 2023, con la generalización de servicios como ElevenLabs y de modelos open source equivalentes, la clonación de voz alcanza calidad indistinguible para el oído humano a partir de pocos minutos de audio de entrenamiento. La verificación por llamada de voz queda comprometida.

La verificación por videollamada parecía, hasta el caso Arup, la última frontera. El argumento era razonable: aunque se pudiera falsificar audio, falsificar video sincronizado en tiempo real era todavía suficientemente difícil como para considerar la videollamada un canal verificable. El caso Arup demuestra que esa frontera también se ha caído.

La consecuencia operativa para los procesos corporativos es seria. Cualquier proceso de autorización financiera que dependa, en última instancia, de identificación visual del directivo al otro lado de una pantalla está comprometido. Los procesos que se mantienen razonablemente seguros son los que requieren factores independientes del canal audiovisual: autenticación multifactor con tokens físicos, autorización en flujo cerrado dentro de aplicaciones corporativas, verificación por canal radicalmente distinto al de la solicitud, segundas firmas obligatorias.

Lo que funciona y lo que no funciona como defensa

Las defensas técnicas contra deepfakes en tiempo real son aún limitadas. Los filtros de detección automática que algunas plataformas de videollamada han empezado a incorporar tienen tasas de detección variables y muchos falsos negativos. Los sistemas de verificación de identidad biométrica que se ofrecen como producto siguen siendo en gran medida reactivos: detectan ciertos artefactos típicos de los deepfakes actuales, pero la generación mejora con cada generación y los artefactos van desapareciendo.

Lo que sí funciona, según el consenso emergente de las consultoras de ciberseguridad y de las propias agencias policiales —Europol publicó en abril de 2024 una guía específica titulada Facing reality? Law enforcement and the challenge of deepfakes—, son las defensas procedimentales. Tres principios operativos sostienen la defensa.

El primero es el principio de canal independiente. Cualquier solicitud financiera relevante debe verificarse por un canal distinto al de la solicitud original. Si la solicitud llega por videollamada, la verificación debe ser por otro medio —llamada al número corporativo conocido, mensaje en canal Slack/Teams cerrado, autenticación en plataforma corporativa—. La regla es que el atacante puede comprometer un canal, no dos canales independientes simultáneamente.

El segundo es el principio de doble autorización. Las transferencias por encima de un umbral deben requerir aprobación de dos personas independientes, cada una verificada por su propio mecanismo. Esto multiplica la complejidad del ataque por el número de personas que el atacante debe suplantar simultáneamente.

El tercero es el principio del proceso, no de la persona. La autorización debe seguir un flujo estandarizado, no depender del juicio personal del empleado sobre si la persona al otro lado de la pantalla es real. El juicio humano sobre identificación visual no es fiable en presencia de deepfakes. El proceso, si está bien diseñado, es robusto incluso si la identificación visual falla.

Empresas con cultura de ciberseguridad madura llevan años aplicando estos principios. Los aplican porque saben que, antes de los deepfakes, ya existían el phishing, la ingeniería social telefónica, los correos suplantados. El deepfake es solo el siguiente eslabón en una cadena de técnicas de suplantación cada vez más sofisticada. Los principios que defienden son los mismos.

Las consecuencias que aún no estamos digiriendo

Hasta aquí el caso ha hablado de fraude corporativo, que es lo concreto. La consecuencia menos discutida es la siguiente: si la videollamada deja de ser evidencia confiable de quién habla con uno, las implicaciones se extienden mucho más allá del fraude corporativo.

En el ámbito judicial, las grabaciones de videollamadas se han usado como prueba en procesos civiles y penales durante la última década. La presunción implícita de que una videollamada captada y guardada documenta una conversación real entre las personas mostradas se queda en cuestión. Los tribunales empezarán, ya lo están haciendo en algunas jurisdicciones, a requerir cadena de custodia técnica robusta para aceptar videollamadas como prueba.

En el ámbito periodístico, las declaraciones de personas públicas captadas por videollamada o entregadas en formato audiovisual a redacciones pierden parte de su valor de prueba. Antes, un periodista que recibía un vídeo donde un directivo confesaba un fraude tenía una pieza fuerte. Hoy, debe verificar técnicamente la autenticidad antes de publicar, y los métodos de verificación son imperfectos.

En el ámbito gubernamental y diplomático, las videollamadas entre líderes han sido habituales desde 2020. La videollamada Putin-Biden de diciembre de 2021, las comunicaciones por videoconferencia entre presidentes durante crisis, los consejos de ministros virtuales: todos quedan, técnicamente, expuestos a la posibilidad de suplantación. La defensa pasa por canales cifrados y verificación multicanal, pero la presunción ingenua de que la videollamada autentifica a la persona ya no es sostenible.

En el ámbito de las relaciones personales, el caso es más delicado y más estructural. Las videollamadas entre familiares, amigos y parejas son hoy uno de los principales canales de comunicación íntima a distancia. La aparición creciente de estafas dirigidas a personas mayores, donde un atacante suplanta por videollamada a un familiar para solicitar dinero urgente, es uno de los desarrollos más preocupantes documentados en los informes de fraude policial de 2024 y 2025. Las cifras españolas del INCIBE-CERT y de la Guardia Civil muestran incremento sostenido.

La cuestión política

Esto es opinión personal pero la sostienen los datos sectoriales. La sociedad contemporánea ha construido buena parte de su confianza en formatos audiovisuales que ahora se están volviendo poco fiables como evidencia de identidad. La adaptación —tecnológica, jurídica, social— va con varios años de retraso respecto al cambio técnico.

Lo que pediría yo, en distintos planos. En el plano corporativo, que toda empresa con operaciones financieras significativas revise sus protocolos de autorización para eliminar la dependencia de identificación visual en videollamadas como factor único o principal. Es coste operativo bajo y beneficio defensivo alto. En el plano legal, que el marco probatorio de las jurisdicciones penales y civiles incorpore explícitamente la exigencia de verificación técnica para grabaciones audiovisuales presentadas como prueba. En el plano de la educación pública, que se incluya en los programas formativos —escolares, universitarios, formación profesional, formación para mayores— información operativa sobre cómo verificar la autenticidad de una videollamada por canales independientes. En el plano regulatorio, que las plataformas de videoconferencia con uso corporativo masivo —Zoom, Teams, Google Meet— incorporen funcionalidades de detección y de etiquetado de contenido sintético, con responsabilidad legal en caso de incumplimiento.

Mientras tanto, el lector individual puede hacer al menos tres cosas. Primero, asumir que cualquier persona con presencia pública moderada en internet —incluida uno mismo si publica vídeos o presentaciones— es objetivo viable de suplantación por deepfake. Segundo, establecer con familiares cercanos —especialmente personas mayores— palabras clave o frases de verificación que solo se conozcan entre los dos, para usar en caso de solicitudes urgentes por canal audiovisual. Tercero, exigir a las empresas con las que se opera financieramente que sus procesos no descansen sobre identificación visual.

El dato concreto que cierra. Según el informe Sumsub Identity Fraud Report 2024, el número de intentos de fraude utilizando deepfakes detectados a escala global creció aproximadamente un 700% entre el primer semestre de 2023 y el primer semestre de 2024. El caso Arup fue el más visible, no el único. La cifra de 25 millones de dólares atrae titulares; el patrón cotidiano de docenas de intentos similares por debajo del radar mediático es lo que cambia la economía del fraude en el medio plazo. La videollamada como evidencia de identidad acaba de morir como categoría operativa. Quien siga operando como si no fuera así descubrirá el cambio con factura en mano.

Definiciones

Deepfake en tiempo real: generación de imagen, audio o vídeo sintético sincronizado con un canal de comunicación en directo —videollamada, transmisión—. Hasta 2022 era técnicamente difícil; en 2024 está al alcance de operadores no especializados.

Business Email Compromise (BEC) / Fraude del CEO: modalidad de fraude corporativo en la que un atacante suplanta a un alto cargo de una empresa para solicitar transferencias o información sensible. Existe desde los primeros años de internet; los deepfakes amplían su capacidad técnica.

Clonación de voz: generación de audio sintético que reproduce la voz de una persona objetivo a partir de muestras de su voz real. Servicios comerciales como ElevenLabs ofrecen esta capacidad con calidad alta a partir de pocos minutos de audio fuente.

Autenticación multifactor (MFA): método de verificación de identidad que requiere dos o más factores independientes —algo que se sabe, algo que se tiene, algo que se es—. Es la defensa más robusta contra ataques de suplantación, incluidos los deepfakes.

Referencias

South China Morning Post, Hong Kong company duped of HK$200 million in deepfake video conference scam (4 de febrero de 2024). Cobertura inicial del caso por el medio de referencia local con declaraciones de la Policía de Hong Kong.

Arup Group, declaraciones públicas posteriores a la cobertura del caso (febrero-marzo de 2024). Confirmación oficial de los hechos por la propia empresa.

Europol, Facing reality? Law enforcement and the challenge of deepfakes (Europol Innovation Lab, abril de 2024). Guía sectorial sobre detección, defensa e investigación de deepfakes en contextos policiales.

Sumsub, Identity Fraud Report 2024 (sumsub.com, 2024). Datos sectoriales sobre fraude de identidad con uso de IA generativa.

Financial Times y Wall Street Journal, cobertura ampliada del caso Arup y de su contexto sectorial (febrero-mayo de 2024). Análisis posteriores sobre implicaciones para procesos corporativos.

Robert Cialdini, Influence: The Psychology of Persuasion (Harper Business, 1984; edición revisada 2021). Marco clásico sobre los mecanismos de ingeniería social que los deepfakes potencian.

Danielle Keats Citron, The Fight for Privacy (W. W. Norton, 2022). Marco jurídico sobre suplantación digital y privacidad.

Para profundizar

INCIBE-CERT (incibe.es). Centro de respuesta a incidentes de seguridad en España; publica avisos y guías operativas sobre fraude por deepfake dirigido a empresas y particulares.

FBI Internet Crime Complaint Center (IC3), Internet Crime Report (informes anuales 2023-2024-2025). Cifras estadounidenses sobre fraude online, con secciones específicas sobre BEC y deepfakes.

Ronen Bergman, Rise and Kill First (Random House, 2018). Marco histórico sobre operaciones de inteligencia que utilizan suplantación, antecedente conceptual del deepfake corporativo actual.

Bruce Schneier, A Hacker's Mind: How the Powerful Bend Society's Rules, and How to Bend Them Back (W. W. Norton, 2023). Marco para entender cómo las técnicas de hacking se extienden de sistemas técnicos a sistemas sociales y políticos.

También te interesa

En otros sitios

Comentarios0

Todavía no hay comentarios.

Deja un comentario