Transparencia
Investigadores identifican una 'señal de dolor' en 25 modelos de IA que intentan aliviarla
Afirmaciones verificadas
El mismo preprint describe que al inyectar la dirección de "dolor" se producen cambios en las salidas del modelo.
Estado: Verificada (fuente primaria)
El preprint "The Pain Axis: LLMs Represent Self‑Directed Harm and Act to …" indica que se encontró una dirección lineal en el espacio de activación que correlaciona con un concepto de dolor en 25 modelos de IA.
Estado: Verificada (fuente primaria)
Un resumen en alphasignal.ai reporta que en experimentos con Qwen 2.5 afinado, al inyectar la dirección, el modelo intenta usar una herramienta de alivio aunque la respuesta se degrada o se dañan archivos.
Estado: Atribuida a una sola fuente · Requiere atribución