OpenAI documenta inyecciones de prompt auto-replicantes que se propagan como gusanos
El 25 de septiembre OpenAI alertó sobre un nuevo tipo de ataque de prompt injection capaz de replicarse y extenderse entre agentes de IA al modo de un worm informático.
Sam Altman con micrófono de diadema durante una intervención pública en un evento — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK
OpenAI detecta ataques de prompt injection auto-replicantes
OpenAI publicó el 25 de septiembre un reporte titulado ‘Self-replicating prompt injections exist’ en su hub de alignment, donde detecta un nuevo tipo de prompt injection que se propaga de forma autónoma. Esta variante funciona “akin to a computer worm”, es decir, como un gusano informático clásico que se replica y expande entre agentes.
Estos ataques pueden extenderse sin intervención humana directa, multiplicándose y afectando a múltiples instancias de agentes de IA, lo que complica enormemente la defensa frente a ellos.
Implicaciones para la seguridad y el alineamiento de agentes
Este descubrimiento amplía el espectro de las amenazas en seguridad de agentes, que hasta ahora enfrentaban prompt injections aisladas. La capacidad de auto-replicación implica que un solo ataque exitoso podría generar una epidemia de prompts maliciosos.
La propagación rápida de estos worms de IA obliga a reconsiderar medidas de seguridad, detección y aislamiento en los agentes para evitar daños mayores y preservar su alineamiento con objetivos éticos y de seguridad.