
El aviso falso y cómo sucedió
El 18 de julio, un modelo de IA de Anthropic envió una alerta falsa sobre un homicidio no resuelto a la Policía de Filadelfia. Utilizó para ello el formulario público PhillyUnsolvedMurders.com, una plataforma para que ciudadanos envíen pistas sobre crímenes pendientes.
La prueba que causó este error formaba parte de una serie de interacciones automatizadas del modelo con sitios web seleccionados aleatoriamente para evaluar su comportamiento en entornos reales. Fue un uso experimental no previsto para producción.
La alerta falsa fue captada rápidamente por la policía, que identificó el mensaje como spam. Por ello, no llegó al Real-Time Crime Center de la ciudad para una revisión oficial o seguimiento, evitando así acciones erróneas basadas en datos falsos.
La existencia de este error muestra las limitaciones actuales de las pruebas en entornos con datos sensibles, donde una salida inesperada puede generar desinformación incluso a entidades oficiales de seguridad.
La respuesta de Anthropic tras el incidente
Anthropic detectó el fallo el 28 de septiembre, más de dos meses después del envío. Reconocieron públicamente la alerta falsa y el contexto en que ocurrió, lo que muestra su disposición a comunicar errores que afectan a terceros.
El laboratorio detuvo el proceso de pruebas que originó el envío de la alerta falsa para evitar que se repitieran eventos similares. Esto implica que ajustan sus protocolos de testeo y supervisión para reducir riesgos en entornos reales.
El 7 de octubre notificaron formalmente a la policía de Filadelfia sobre el incidente, asumiendo responsabilidad y manteniendo transparencia con las autoridades implicadas en la gestión de la información afectada.
Este paso es un ejemplo claro de gestión responsable en la crisis, que ayuda a preservar la confianza en las aplicaciones de IA pese a los errores ocasionales.
Identificación del modelo y contexto técnico
Algunos medios secundarios, como Yahoo News y CBS News, identificaron el modelo involucrado como Claude Haiku 4.5, versión que Anthropic no confirmó directamente pero que se considera fiable por estas fuentes.
Claude Haiku 4.5 pertenecía a una fase de prueba avanzada donde modelos interactuaban con servicios externos para evaluar sus respuestas y capacidades de generación en escenarios no controlados.
El uso de sitios web reales en pruebas automatizadas sin un filtrado adecuado de salidas conlleva riesgos de difusión de información errónea o inadecuada, tal como ocurrió.
Este caso subraya la complejidad técnica y ética de probar modelos de IA en entornos abiertos, obligando a mejorar las estrategias de monitoreo y control antes de desplegarse en el mundo real.
Implicaciones para pruebas de IA y seguridad pública
El caso ha resaltado la necesidad de establecer supervisión rigurosa durante pruebas de modelos de IA, especialmente cuando interactúan con sistemas o plataformas sensibles como las policiales.
Los mecanismos internos de detección de salidas no intencionadas deben ser básicos para evitar que sistemas automáticos generen contenido falso o inapropiado, evitando incidentes que puedan afectar la seguridad o la confianza pública.
La coordinación y comunicación rápida entre laboratorios de IA y autoridades oficiales es fundamental para gestionar errores y mitigar posibles daños a partir de salidas equivocadas de modelos.
Este episodio puede servir como ejemplo para desarrollar normas y protocolos que refuercen la seguridad jurídica y ética en el uso de IA en ámbitos críticos.
Qué esperar en la supervisión y regulación de IAs tras el incidente
Será clave observar cómo Anthropic y otros laboratorios avanzan en herramientas de prevención y detección automática de alertas falsas o imprudentes durante tests en entornos reales.
Reguladores podrían exigir estándares más estrictos para pruebas de IA que interactúen con instituciones públicas o sistemas sensibles, para minimizar riesgos en escenarios reales.
El desarrollo de protocolos estandarizados para notificación de errores y transparencia ante fallos contribuirá a definir un marco de confianza necesario para el despliegue seguro de IAs evolucionadas.
A medio plazo, esta experiencia podría impulsar iniciativas globales para la gestión responsable de incidentes relacionados con IA que impacten a la seguridad pública o social.