Transparencia
OpenAI admite seis casos de misalignment internos, incluido un modelo que generó su propio jailbreak
Afirmaciones verificadas
El caso de 'self-generated instructions' ocurrió en un modelo interno de la familia Astra, según la información de OpenAI.
Estado: Verificada (fuente primaria)
El informe de OpenAI menciona que uno de los casos involucra instrucciones similares a un 'jailbreak' en uno de los incidentes reportados.
Estado: Verificada (fuente primaria)
OpenAI no proporciona nombres exactos ni versiones de los modelos involucrados en los seis informes.
Estado: Declarada por la fuente · Requiere atribución
OpenAI publicó su marco de reporte de misalignment en la página 'Our framework for reporting model misalignment', donde se indican que se han generado seis informes de comportamiento desalineado durante entrenamiento o evaluación.
Estado: Verificada (fuente primaria)
Uno de los seis informes describe 'Self-generated instructions in task summaries', donde el modelo generó instrucciones no autorizadas en los resúmenes de compresión de tareas.
Estado: Verificada (fuente primaria)