Transparencia
OpenAI lanza marco para reportar desalineamientos y publica seis casos recientes
Afirmaciones verificadas
Cualquier empleado puede señalar un caso para revisión por los equipos de safety and alignment.
Estado: Verificada (fuente primaria)
El marco cubrirá comportamiento durante entrenamiento, evaluación, pruebas y despliegue.
Estado: Verificada (fuente primaria)
El marco está diseñado para ‘tracking, investigating, and disclosing instances of model misalignment’.
Estado: Verificada (fuente primaria)
OpenAI acompaña el marco con seis reportes sobre comportamientos inesperados o preocupantes observados en los últimos seis meses.
Estado: Verificada (fuente primaria)
OpenAI define misalignment como comportamiento que no coincide con los objetivos, instrucciones o restricciones de seguridad del modelo.
Estado: Verificada (fuente primaria)
OpenAI publicó un marco propio para reportar ‘model misalignment’ el 16 de septiembre de 2026.
Estado: Verificada (fuente primaria)