Sam Altman con micrófono de diadema durante una intervención pública en un evento
Sam Altman con micrófono de diadema durante una intervención pública en un evento — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK

OpenAI detecta ataques de prompt injection auto-replicantes

OpenAI publicó el 25 de septiembre un reporte titulado ‘Self-replicating prompt injections exist’ en su hub de alignment, donde detecta un nuevo tipo de prompt injection que se propaga de forma autónoma. Esta variante funciona “akin to a computer worm”, es decir, como un gusano informático clásico que se replica y expande entre agentes.

Estos ataques pueden extenderse sin intervención humana directa, multiplicándose y afectando a múltiples instancias de agentes de IA, lo que complica enormemente la defensa frente a ellos.

Implicaciones para la seguridad y el alineamiento de agentes

Este descubrimiento amplía el espectro de las amenazas en seguridad de agentes, que hasta ahora enfrentaban prompt injections aisladas. La capacidad de auto-replicación implica que un solo ataque exitoso podría generar una epidemia de prompts maliciosos.

La propagación rápida de estos worms de IA obliga a reconsiderar medidas de seguridad, detección y aislamiento en los agentes para evitar daños mayores y preservar su alineamiento con objetivos éticos y de seguridad.