
Anthropic prueba un sistema automatizado que corrige fallos de alineamiento de sus modelos de IA
Un paper de Anthropic, liderado por el investigador Chen Yueh-Han, describe un sistema que busca literatura, propone métodos y entrena modelos de forma iterativa para reducir comportamientos desalineados.