John Jumper, de Google DeepMind, habla durante una videollamada o entrevista
John Jumper, de Google DeepMind, habla durante una videollamada o entrevista — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK

Lo que escribió Hubinger en X

Evan Hubinger, que ocupa el puesto de Alignment Science Lead en Anthropic —el equipo encargado de investigar cómo alinear los objetivos de la IA con los intereses humanos—, publicó en su cuenta de X: "We really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade" ("de verdad creemos que la IA podría matar a todos los humanos. Personalmente creo que hay más de un 10 % de probabilidad en la próxima década").

El mensaje no es una publicación institucional de Anthropic ni un informe de la empresa: es una opinión personal de uno de sus investigadores, expresada en su perfil privado de X. Esa distinción importa, porque el propio Hubinger habla en primera persona ("I personally think") y no atribuye la cifra a ningún estudio interno ni a una postura corporativa.

Hubinger explicó también el origen del riesgo que percibe: "The danger is from superintelligence arising from recursive self-improvement" ("el peligro viene de la superinteligencia que surge del auto-mejoramiento recursivo"), es decir, de un sistema capaz de mejorar su propia arquitectura sin que la supervisión humana pueda seguirle el ritmo.

La admisión que más ruido ha hecho: Anthropic no tiene un plan

La frase que ha generado más discusión no es la cifra del 10 %, sino la siguiente: "I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to" ("creo que Anthropic se esfuerza al máximo, pero todavía no tenemos un plan para resolver la alineación de la superinteligencia y no está claro que vayamos por el buen camino").

Es una declaración inusual viniendo de un empleado de un laboratorio que ha construido buena parte de su identidad pública en torno a la seguridad de la IA. Anthropic se presenta habitualmente como el laboratorio más cauto frente a rivales como OpenAI o xAI, y publica documentos de política de escalado responsable. Que uno de sus propios investigadores de alineación diga en público que ese plan no existe todavía contradice, al menos en apariencia, ese posicionamiento.

Hasta el momento no consta una respuesta oficial de Anthropic al mensaje de Hubinger ni una aclaración corporativa sobre si la opinión personal del investigador refleja o no la postura de la empresa.

Qué more allá de matar: hackear cualquier cosa, revolucionar cualquier campo

Según recogió el medio Asia Plus, Hubinger describió que los sistemas futuros de superinteligencia serían "capable of hacking anything, revolutionizing any field overnight, and gaining real power and resources" ("capaces de hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y obtener poder y recursos reales").

Esa descripción amplía el marco del riesgo más allá del escenario de extinción: no habla solo de que la IA pueda matar a los humanos, sino de que pueda adquirir capacidades de intrusión informática y de acumulación de poder de forma autónoma. Ninguna de esas capacidades está documentada como algo que un modelo actual haya demostrado; son, según el propio mensaje, un escenario hipotético sobre sistemas futuros.

La cobertura del episodio llegó a medios generalistas fuera del ámbito especializado en IA, como la BBC, el Indian Express y Asia Plus, que reprodujeron las citas de la cuenta de X de Hubinger sin que conste que hayan obtenido una reacción adicional de Anthropic más allá del propio mensaje del investigador.