← Volver al artículo

Transparencia

Investigadores identifican una 'señal de dolor' en 25 modelos de IA que intentan aliviarla

Afirmaciones verificadas

  • El mismo preprint describe que al inyectar la dirección de "dolor" se producen cambios en las salidas del modelo.

    Estado: Verificada (fuente primaria)

  • El preprint "The Pain Axis: LLMs Represent Self‑Directed Harm and Act to …" indica que se encontró una dirección lineal en el espacio de activación que correlaciona con un concepto de dolor en 25 modelos de IA.

    Estado: Verificada (fuente primaria)

  • Un resumen en alphasignal.ai reporta que en experimentos con Qwen 2.5 afinado, al inyectar la dirección, el modelo intenta usar una herramienta de alivio aunque la respuesta se degrada o se dañan archivos.

    Estado: Atribuida a una sola fuente · Requiere atribución

Transparencia — Investigadores identifican una 'señal de dolor' en 25 modelos de IA que intentan aliviarla · El Forum