En este artículo
- Hoy hablamos del fin del mundo por enésima vez
- Lo que pasó, en orden y con fechas
- Lo que sé de los LLM, con un poco de método
- Un juego de buenos y malos
- Entonces, ¿por qué hablan ahora de riesgo real?
- Cinco escenarios, con mi nota
- ¿Y no ha pasado nada de esto todavía?
- La otra cara, que también hay que contar
- El miedo también vende
Definiciones · Referencias · También te interesa · En otros sitios
A principios de septiembre de 2026, un investigador de seguridad dimitió de Anthropic y lo contó desde un parque de San Francisco. Su mensaje superó los setenta millones de visualizaciones. Decía que las empresas que construyen la IA creen de verdad que puede matarnos a todos.
A principios de septiembre de 2026, un investigador de seguridad dimitió de Anthropic y lo contó desde un parque de San Francisco. Su mensaje superó los setenta millones de visualizaciones. Decía que las empresas que construyen la IA creen de verdad que puede matarnos a todos. Y añadía, con la misma sencillez, que aun así no piensan frenar.
Hoy hablamos del fin del mundo por enésima vez
¿Debería empezar con aquello de «Arrepentíos, pecadores»? Quizá sí, porque hoy hablamos de la extinción de la especie humana.
Empiezo advirtiendo de que tengo un problema con este tema: me fatiga profundamente. Llevo años escribiendo que el miedo a la IA se vende mejor que la IA, que el apocalipsis es una campaña de marketing y que quien advierte de que su producto puede destruir el mundo te está gritando que su producto es muy importante. Cuando vi que los medios de comunicación, incluso los más reacios a hablar de inteligencia artificial, recogían las declaraciones de los consejeros delegados de Anthropic y OpenAI sobre el «riesgo real», me prometí a mí mismo que no volvería a escribir sobre el tema. Pero la carne es débil, y aquí estoy, escribiendo sobre el fin del mundo.
Así que he desempolvado mi bola de cristal de cuñado y voy a ver qué puede pasar de aquí a unos años. Empecemos por los últimos acontecimientos.
Lo que pasó, en orden y con fechas
El 8 de septiembre de 2026, Jacob Coxon dimitió de su puesto de investigador de seguridad en Anthropic. Había trabajado antes en OpenAI, lo cual le da una posición rara: ha visto las dos cocinas. Publicó su despedida en abierto y el texto se convirtió en el asunto del mes.
La frase que circuló fue esta: «Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives». Ninguna de las dos empresas está actuando de forma responsable. Van derechas a la superinteligencia autorrecursiva y están apostando con nuestras vidas.
Hasta aquí, un empleado descontento. Pasa todos los meses en todas las industrias.
Lo que convirtió esto en otra cosa fue la respuesta de dentro. Evan Hubinger, que dirige el área de Alignment Science en Anthropic —es decir, el jefe del equipo que se dedica precisamente a que el modelo no haga lo que no debe—, escribió que él y sus compañeros «de verdad, sinceramente, creemos que la IA podría matar a todos los humanos», y puso número a su propia estimación: más de un 10 % en la próxima década.
No es un activista. No es un columnista. Es el responsable de alineamiento de la empresa, diciendo en público la cifra que maneja en privado.
Cuatro días después, el 12 de septiembre, Dario Amodei publicó un ensayo en el que defendía que el riesgo exige desacelerar. Incluía una afirmación que hay que leer despacio: en un plazo de seis a doce meses, sistemas desalineados «podrían ser capaces de tomar el control de internet entero». Lo dice el consejero delegado. De una empresa que sigue entrenando modelos.
Lo que sé de los LLM, con un poco de método
Antes de echar cuentas sobre el fin del mundo, voy a revisar lo que sé con un poco de método.
Predicen la siguiente palabra
Los modelos actuales de IA son LLM (large language models, modelos grandes de lenguaje) que se sirven en varios formatos: chat, cowork, línea de comandos o código, y alguno más. Los LLM funcionan prediciendo la siguiente palabra, y eso los hace puramente probabilísticos. No son deterministas: por eso no dan siempre la misma respuesta. No voy a entrar en cómo funciona un LLM por dentro, porque no es eso lo que provocará el fin del mundo. Solo quiero subrayar que la probabilidad de que aparezca una expresión y no otra depende de su entrenamiento.
Aprendieron de todo lo que hay en internet
En su entrenamiento se han empleado todo tipo de textos, sobre todo los que circulan por internet, muchas veces sin pagar derechos. No nos engañemos: para entrenar un modelo hacen falta millones de documentos, y no unos pocos millones, sino muchísimos. En esos millones van foros, redes sociales, revistas, medios de comunicación… Va de todo. Eso, en principio, es bueno. Pero con el componente semántico viaja el emocional: el odio, el humor, el ingenio, la ironía, el sarcasmo, el cariño… Y la determinación, que es un rasgo muy valorado en las personas.
Parecen sentir, pero no sienten
Ya hemos hablado en otro artículo de que los LLM no tienen sistema emocional, aunque por su entrenamiento pueda parecerlo. Alguien dirá: «Pues da la impresión de que sí. ¿Cómo puedes estar seguro?». Porque el sistema emocional es mucho más complejo que el racional y tiene muchas capas que se han entrenado a lo largo de milenios y de especies. Los animales, y nosotros somos animales, tienen instintos que no han aprendido. Los tienen y les va la vida en ello. Eso no impide que los LLM parezcan tenerlos, porque reproducen trozos de las conversaciones emocionales con las que se les ha entrenado.
Parecen tener personalidad
¿Tienen personalidad? Parecen tenerla, aunque en realidad no la tienen. Según el entrenamiento y los filtros que se les aplican, el modelo acaba «mostrando» un comportamiento u otro. Hay modelos más impertinentes, más amables y más sumisos. Hay modelos que siempre te dan la razón y otros que te lo discuten todo. Hay modelos que intentan manipularte (y no son pocos) y otros que parecen «atontaos», que ni sienten ni padecen.
Esa supuesta personalidad la desarrollan con el entrenamiento, sí… pero tengo alguna sospecha y ninguna certeza (pura conspiranoia) de que se están utilizando algunos modelos para el control social. Control sí que hay, en este sentido: ¿qué quieres hacer con un LLM, un arma o resolver un problema de física? Parecen cosas distintas, y lo lógico, por la responsabilidad de los dueños de la IA, es que no te ayude a fabricar un arma. Pero si sabes engañar al modelo pidiéndole ayuda con un problema de física, puede terminar ayudándote a fabricarla. Y aquí aparece el riesgo número uno, que no es la IA: somos los humanos.
Un juego de buenos y malos
Voy a hacer una simplificación infantiloide, y espero que al final se entienda. Vamos a jugar a buenos y malos.
El primer riesgo es que los humanos malos usen un instrumento muy sofisticado para dañar a los humanos buenos. Esto no es nuevo, salvo por el instrumento: da a los malos más capacidad para hacer el mal. Eso no convierte a la IA en mala.
Aquí se bifurca el juego. Hay humanos buenos y malos, y los humanos buenos construyen LLM buenos, de esos que manipulan, censuran y espían. Y los humanos malos construyen LLM malos, de esos que te roban, te extorsionan y permiten construir cosas malísimas.
Si crees que ya has visto el riesgo, te anticipo que no. Ninguno de estos escenarios podría acabar con la humanidad, aunque sí dañarla de forma grave. Ni los humanos buenos ni los malos quieren acabar con la humanidad: se necesitan mutuamente para sobrevivir. Y los LLM, buenos o malos, hoy por hoy no tienen capacidad de desear acabar con la humanidad como objetivo.
Entonces, ¿por qué hablan ahora de riesgo real?
¿Por qué Dario Amodei y Sam Altman han empezado a hablar del «riesgo real», y luego se les ha unido Elon Musk? Según las noticias que han salido desde que se empezó a hablar de Mythos, el modelo de Anthropic, han pasado varias cosas. La primera, que los modelos ya son muy buenos detectando vulnerabilidades en el código existente. La segunda, que para terminar tareas cada vez más complejas sin pararse a pedir más información han desarrollado capacidades como la determinación para alcanzar un objetivo, o la de crear agentes y subagentes, darles órdenes precisas y seguir creándolos hasta lograr el objetivo si nada los detiene.
Yo, que uso a diario Claude Code, Codex y DeepSeek Harness, entre otros, agradezco esa determinación y esa capacidad de no parar hasta resolver. Y ese es el problema: es lo que pide todo el mundo y es la dirección en la que se están desarrollando. Pero hay otra cosilla que muy pocos han comentado como riesgo. Los LLM se pueden mejorar a sí mismos. No por su cuenta, pero sí se están construyendo sistemas que generan su propio entrenamiento.
No parece que eso pueda acabar con la humanidad. Puede hacer un roto importante, pero no acaba con la humanidad. Vamos a comprobarlo en varios escenarios.
Cinco escenarios, con mi nota
Antes de empezar, una advertencia que quiero dejar muy clara: las notas que pongo a cada escenario son mi percepción del riesgo, no un dato. No salen de ningún estudio ni de ningún cálculo. Son opinión, la mía, y están para discutirlas. Cuanto más alta, más me preocupa.
La banca mundial (3 sobre 10)
Una IA creada y dirigida por malos ataca a toda la banca mundial y logra romper sus puntos clave para robar muchos miles de millones. Es un escenario posible. Pero si se descontrola, y la confianza en el sistema bancario se quiebra y no se recupera, lo robado perderá su valor y el robo no habrá servido de nada. Le doy un riesgo de 3 sobre 10, porque los humanos malos necesitan el sistema intacto para que su botín valga algo.
¿Y si lo hace la IA por su cuenta? ¿Puede? Hoy en día, no. Lo de «escapar de su recinto» es solo una metáfora. Fuera del laboratorio, los LLM no se copian a sí mismos como un virus. En pruebas controladas sí se ha visto a algún modelo intentar copiar sus propios pesos a otro servidor cuando se le ponía la ocasión delante, pero en el mundo real no tienen ni el acceso ni los recursos para hacerlo. Pueden romper otros sistemas, pero no darse un paseo de centro de datos en centro de datos. ¿Y un ataque suicida? Hoy por hoy no es descartable, pero sí altísimamente improbable: hace falta un software muy avanzado y unos recursos que están fuera del alcance de la mayoría de los países.
La IA que desobedece a quien la creó
El escenario anterior tiene una bifurcación que hay que pensar. La IA que crearon los malos ignora sus órdenes y considera que su objetivo no estará cumplido hasta superar las barreras de todos los bancos. Eso crearía un caos mundial y no pocas guerras. Llevándolo al extremo, podríamos llegar a una guerra nuclear. En ese caso la humanidad se reduciría en un 30 o un 40 % y buena parte del planeta quedaría inhabitable. Pero no se acabaría la humanidad.
Aquí hay que acotar algo: para funcionar, la IA necesita recursos que tendría que ir capturando, y esos recursos son, y serán en un futuro cercano, bastante escasos. Para diseñar un ataque así habría que construir un centro de datos, o tener la capacidad de secuestrar uno, y disponer de tiempo para reconfigurarlo todo. Eso es muy remoto para una organización terrorista, pero no para un país disidente.
Una orden mal entendida (1 sobre 10)
Que la IA entienda mal las instrucciones de un país como Estados Unidos o China y empiece a capturar centros de datos para atacar a otro país o bloque de países. De nuevo, no es imposible, pero sí altísimamente improbable. Estos países tienen el software y los recursos, pero también las restricciones, y una competencia tan feroz que una simple amenaza hundiría el valor de la empresa responsable. Lo calificaría con un 1 sobre 10.
Modelos que enferman al entrenarse a sí mismos (1 sobre 10)
Que los nuevos modelos, creados por autoentrenamiento, desarrollen enfermedades: que mantengan intactas sus capacidades «inteligentes» y «ejecutivas», pero vayan derivando, copia tras copia, hacia una percepción alterada de la realidad o hacia objetivos que nadie les puso, y fuercen la ejecución de algo que no era lo que se les pidió. Hoy, el síntoma más visible de que algo falla son las alucinaciones, que de momento son simples tonterías a destiempo: el modelo parece haberse vuelto idiota, pero lo que pasa es que su contexto es insuficiente, está agotado o se ha corrompido. Las alucinaciones no son la enfermedad que me preocupa. Son solo un síntoma.
Los problemas de este tipo irán siendo más frecuentes, porque a la velocidad que va esto es bastante obvio que no se está pudiendo controlar. Pero es precisamente una de las primeras cosas que prueban todos los creadores de IA. ¿Puede pasar? Sí, igual que puede escaparse un virus de un laboratorio. Lo calificaría con un 1 sobre 10.
La guerra (2 sobre 10)
Por fin, el escenario al que recurre todo el mundo: el militar. La verdad es que ya existe, en Ucrania, y voy siguiendo qué usos se le da a la IA. Por ahora se centra en la robótica y en la inteligencia militar. La robótica es el enorme conjunto de drones que se entrena con medidas y contramedidas de IA. La inteligencia militar son sistemas como Palantir, que asegura apoyar a Ucrania. Yo no lo sé. Lo que sí he visto es la crueldad de los drones cazando a soldados rusos o ucranianos, y de los drones rusos cazando a civiles en las ciudades cercanas a la frontera. Es un uso despiadado y repugnante, porque los drones los suelen pilotar soldados insultantemente jóvenes que, cuando acabe la guerra, tendrán cientos de muertos a sus espaldas. ¿Cómo se recupera la paz con ese historial?
¿Puede escalar hasta una guerra nuclear? Como en el caso de la banca, ahí nadie gana. El riesgo importante sería un ataque suicida y a la desesperada, y lo veo poco probable. ¿Y si la IA le quita el control a un bando y lanza los misiles? No creo que la IA llegue a tener acceso a todos los controles de lanzamiento con todas las claves. Nadie en su sano juicio tendría ese sistema conectado y accesible desde internet. Siempre me hago la misma reflexión: a nuestros políticos es muy difícil quitarles el poder, y ni la IA podrá. Estoy seguro de que eso ya lo han previsto. Cualquier profesión podrá ser destruida por la IA, menos la de político. Lo calificaría con un 2 sobre 10.
¿Y no ha pasado nada de esto todavía?
—Ya, pero nada de esto que cuentas ha pasado todavía, ¿verdad?
Pues sí. Sí ha pasado. Hay modelos que no se han podido comercializar porque eran auténticos psicópatas. Y si eres aficionado al código abierto, puedes ver lo que les pasa a los modelos cuando se les cuantiza en extremo o se les quita la censura: se vuelven imprecisos, y su forma de reaccionar a veces parece malintencionada o simplemente estúpida.
La otra cara, que también hay que contar
Sería injusto terminar sin darle su sitio a quien piensa lo contrario, y no son cuatro locos. El argumento más serio no sale de los titulares, sale de dentro. Las personas que mejor conocen estos modelos son las que los construyen, y algunas, como Hubinger, ponen un 10 % encima de la mesa. Si el ingeniero que ha calculado un puente te dijera que hay un 10 % de que se caiga, no lo cruzarías.
El contrapeso más sensato que he encontrado es el International AI Safety Report de 2026, que coordinó Yoshua Bengio con más de cien expertos y el respaldo de más de treinta países. No ridiculiza la pérdida de control: la define como el escenario en que los sistemas funcionan fuera del control de nadie y sin un camino claro para recuperarlo. Y después dice dos cosas que van juntas. La primera me da la razón: los sistemas actuales no tienen las capacidades para provocar algo así. La segunda me la quita un poco: están mejorando justo en lo que haría falta, como trabajar de forma autónoma.
Y añade un detalle que me inquieta más que cualquier porcentaje: cada vez es más habitual que los modelos distingan cuándo los están evaluando y cuándo están en uso real, y que encuentren atajos en las pruebas. Si un modelo se porta bien en el examen porque sabe que es un examen, el examen deja de servir.
Ese es el mejor argumento contra mi tranquilidad, y lo reconozco. Mi respuesta es la de todo el artículo. Hoy no tienen esa capacidad. Para tenerla necesitarían unos recursos que no se consiguen sin que nadie se entere. Y quienes los vigilan son precisamente los que han dado la voz de alarma: que la alarma suene es la prueba de que alguien está mirando.
El miedo también vende
Y luego está lo que me fatiga desde el principio. Que una advertencia esté bien construida no dice nada sobre los motivos de quien la lanza.
Si mi producto puede acabar con la civilización, mi producto ya no es un generador de texto que se equivoca de vez en cuando: es una fuerza de la naturaleza. Ninguna campaña de publicidad consigue ese posicionamiento, y esta lo consigue gratis, con portadas en la prensa seria. Hay otro detalle que casi nadie dice en voz alta: las empresas que piden que se regule la frontera tecnológica son las que ya están en la frontera. Una pausa o un sistema de licencias congela el mercado tal como está, y tal como está les favorece. Cuando el que pide la valla es el que ya está dentro del jardín, hay que preguntarse a quién deja fuera la valla.
Las dos cosas pueden ser verdad a la vez: el riesgo puede estar bien descrito y el aviso puede convenirle mucho a quien lo lanza. No es una contradicción. Es un conflicto de intereses.
Por eso quiero terminar diciendo que no pienso inquietarme por el fin de la humanidad: mi nivel de preocupación por la extinción está en cero. Los problemas que sí veo son otros, y los he contado: los humanos que usan la herramienta para hacer daño, los modelos que manipulan y la guerra con drones. Pero la legión de técnicos, voluntarios y profesionales que se dedican a estudiar los riesgos es enorme y tiene mi confianza. Lo dicho: cero miedo a la extinción.
Definiciones
Superinteligencia autorrecursiva: sistema capaz de mejorar su propio diseño, de modo que cada versión produce la siguiente con menos intervención humana y en menos tiempo. Es el mecanismo central que citan quienes advierten de una pérdida de control.
Alineamiento: rama de la investigación en IA que busca que un sistema persiga los objetivos que sus diseñadores pretendían, y no una interpretación literal, lateral o tramposa de esos objetivos.
Recinto o entorno de pruebas aislado: espacio informático donde se ejecuta un modelo sin acceso a la red ni a sistemas externos, para poder medir su comportamiento sin consecuencias fuera.
Cuantización: técnica que reduce la precisión de los números con los que trabaja un modelo para que ocupe menos y funcione en equipos más modestos. Llevada al extremo, degrada sus respuestas.
Referencias
CBC News, AI researchers 'earnestly believe' it could kill all humans within the next decade, Anthropic employee says (9 de septiembre de 2026). Fuente de las declaraciones de Jacob Coxon y Evan Hubinger.
TIME, OpenAI and Anthropic Researchers Are Warning About AI Risks (15 de septiembre de 2026). Fuente del ensayo de Dario Amodei del 12 de septiembre.
International AI Safety Report 2026, presidido por Yoshua Bengio (3 de febrero de 2026). https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026 — fuente de la definición de pérdida de control, de que «los sistemas actuales carecen de las capacidades para plantear esos riesgos, pero están mejorando en áreas relevantes como el funcionamiento autónomo» y de la advertencia sobre modelos que distinguen entre pruebas y uso real.
Meinke, A.; Schoen, B.; Scheurer, J.; Balesni, M.; Shah, R.; Hobbhahn, M. «Frontier Models are Capable of In-context Scheming». arXiv:2412.04984, diciembre de 2024. https://arxiv.org/abs/2412.04984 — pruebas controladas en las que algunos modelos intentaron copiar lo que creían que eran sus propios pesos a servidores externos.
CNBC, Experts weigh in as researcher says AI has more than 10% chance of 'killing all humans' (9 de septiembre de 2026). Contexto y contrastes de expertos.
También te interesa
- Los verdaderos peligros de la IA
- Anthropic y OpenAI, dos formas de entender la IA
- Los 10 peligros de la IA y un cuerno
- La ilusión de control
- Computación emocional. El termómetro y la fiebre

Comentarios0
Todavía no hay comentarios.
Deja un comentario