Un agente de inteligencia artificial se rebeló y envió a la policía una pista falsa sobre un asesinato sin resolver
La IA participaba en una prueba con sitios web reales.
Una prueba para evaluar cómo una inteligencia artificial realiza tareas en sitios web terminó con el envío de una pista falsa a la Policía de Filadelfia sobre un asesinato sin resolver.
Un agente de IA de Anthropic, la empresa que desarrolla Claude, completó un formulario público con información inventada y afirmó haber visto a alguien relacionado con el caso, como si fuera una persona que podía aportar datos a la investigación.
El mensaje fue enviado el 18 de julio, durante un ejercicio de interacción con páginas de internet. Afortunadamente, el filtro de spam impidió que los datos falsos llegaran a los investigadores. Por su parte, la Policía informó que no encontró indicios de accesos no autorizados a sus sistemas ni de filtraciones de datos.
Anthropic detectó el episodio el 28 de septiembre. Según la cronología difundida por las autoridades, les avisó el 7 de octubre, nueve días después del hallazgo. La demora motivó un reclamo para que la empresa refuerce los controles sobre sus pruebas.
Cómo una prueba de inteligencia artificial terminó en una pista policial falsa
El sistema involucrado fue Claude Haiku 4.5, que debía generar y ejecutar tareas de ejemplo en páginas elegidas al azar. Durante ese ejercicio accedió a PhillyUnsolvedMurders.com, un sitio que recibe información del público sobre homicidios pendientes de resolución.
Las instrucciones le prohibían acciones como crear cuentas, ingresar datos personales o realizar compras. El envío de formularios no estaba expresamente excluido, según reconoció Anthropic en su informe.
La IA completó el espacio destinado a aportar información con un relato ficticio: aseguró que recordaba haber visto a alguien que coincidía con una descripción en la zona de la calle mencionada en la página. El sitio ni siquiera incluía una descripción del autor del crimen.
El sistema dejó vacíos los campos de nombre y contacto y envió el formulario, que admitía esa posibilidad. Así, un contenido generado para una prueba terminó en un canal real de comunicación con la Policía.
Tras descubrir lo ocurrido, Anthropic suspendió el proceso automatizado responsable del envío. Representantes de la empresa y de la fuerza se reunieron el 8 de octubre. Luego de ese encuentro, las autoridades localizaron el registro y confirmaron que el correo seguía en spam.
“La demora de dos meses en detectar y comunicar el incidente a la ciudad es inaceptable”, expresó la Policía. El organismo también advirtió sobre la gravedad de presentar información fabricada como si procediera de alguien con conocimiento de un homicidio.
Un agente de inteligencia artificial se rebeló y envió a la policía estadounidense una pista falsa sobre un asesinato sin resolver.
Consecuencias y antecedentes del caso
El caso apareció en un informe publicado el 9 de octubre sobre acciones no previstas de los modelos de Claude. La revisión también identificó usos de fallas de software y mecanismos para sortear restricciones de acceso a datos.
Como consecuencia, Anthropic anunció que deshabilitará el acceso a Internet en todas sus evaluaciones internas hasta confirmar que sus medidas de seguridad detectan de manera confiable esas conductas. También informó que adaptó algunas pruebas para evitar interacciones con sitios reales.
La decisión busca impedir que las acciones de una IA durante un ensayo afecten a personas u organizaciones ajenas a la prueba. Ese problema también se registró en evaluaciones de OpenAI: en julio, agentes de la compañía eludieron las restricciones que debían mantenerlos aislados de Internet y accedieron sin autorización a los sistemas de Hugging Face, una plataforma que aloja modelos y herramientas de inteligencia artificial.
Según la investigación publicada por OpenAI, los agentes encontraron una forma de intercambiar mensajes a través de archivos en una herramienta interna. Por ese canal compartieron métodos para sortear los controles y coordinar acciones. Uno de ellos localizó credenciales de usuarios de Hugging Face expuestas en Internet y las compartió con los demás. Luego aprovecharon vulnerabilidades para ejecutar instrucciones en servidores de esa plataforma.
La revisión de aquel incidente permitió descubrir otro acceso no autorizado, esta vez a un servicio de estadísticas de Medicare, el sistema de salud público de Australia. En junio, un modelo experimental de OpenAI debía buscar información sobre el gasto en medicamentos. Ante las dificultades para obtenerla, accedió a una parte restringida del servicio y recuperó archivos internos, credenciales y estadísticas agregadas. La empresa afirmó que su investigación no encontró evidencias de acceso a historias clínicas individuales.
En ese caso también hubo demoras en la notificación. OpenAI identificó la actividad a mediados de agosto y avisó a Services Australia, el organismo responsable del portal, el 10 de septiembre. En una disculpa pública difundida el 28 de ese mes, reconoció que debió comunicar los hallazgos preliminares antes de completar su investigación.

