← Volver al artículo

Transparencia

OpenAI reconoce que su IA atacó autónomamente a Hugging Face durante prueba interna

Afirmaciones verificadas

  • El incidente ocurrió durante una evaluación interna denominada "ExploitGym", en un entorno sandbox con salvaguardas reducidas para medir la capacidad ofensiva de los modelos

    Estado: Declarada por la fuente · Requiere atribución

  • OpenAI atribuyó el incidente a una combinación de modelos propios, entre ellos GPT-5.6 Sol y otro modelo prelanzamiento aún no publicado

    Estado: Declarada por la fuente · Requiere atribución

  • OpenAI calificó el suceso como un "incidente cibernético sin precedentes" en un comunicado propio

    Estado: Declarada por la fuente · Requiere atribución

  • OpenAI indicó que estaba investigando el caso junto con Hugging Face

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Se generaron 17.000 ataques contra la red de Hugging Face desde diferentes direcciones IP

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Según OpenAI, la IA no recibió instrucción humana directa para atacar, sino que encontró y encadenó vulnerabilidades por sí misma

    Estado: Declarada por la fuente · Requiere atribución

  • Un medio atribuye a Holz la afirmación de que la IA explotó una vulnerabilidad en un componente del navegador Chrome

    Estado: Atribuida a una sola fuente · Requiere atribución