Transparencia
Anthropic prueba un sistema automatizado que corrige fallos de alineamiento de sus modelos de IA
Afirmaciones verificadas
Anthropic mantiene una página institucional titulada 'When AI builds itself' sobre recursive self-improvement, cuyas opiniones son individuales a mayo de 2026 y no posiciones oficiales de la empresa
Estado: Verificada (fuente primaria)
Anthropic publicó un paper titulado 'Automated Researchers Can Reliably Mitigate Alignment Failures'
Estado: Atribuida a una sola fuente · Requiere atribución
Chen Yueh-Han es fellow de Anthropic y lideró el trabajo
Estado: Atribuida a una sola fuente · Requiere atribución
El paper concluye que estos resultados son 'early evidence that automated alignment post-training could become practical in the near term'
Estado: Declarada por la fuente · Requiere atribución
El sistema automatizado mejoró el rendimiento en los 10 benchmarks evaluados de comportamientos desalineados sin degradar el rendimiento general del modelo
Estado: Atribuida a una sola fuente · Requiere atribución
El sistema busca literatura disponible, propone métodos y entrena el modelo con esos métodos de forma iterativa
Estado: Atribuida a una sola fuente · Requiere atribución
El tiempo de entrenamiento fue de 30 minutos por cada método probado
Estado: Atribuida a una sola fuente · Requiere atribución