Un maniquí de inteligencia químico desarrollado por Anthropic envió una pista inventada sobre un homicidio sin resolver a la policía de Filadelfia, dijeron las autoridades el viernes, criticando a la compañía por tomarse dos meses para informar el incidente.
El Sección de Policía de Filadelfia dijo que la presentación falsa se realizó en julio a través de PhillyUnsolvedMurders.com, un sitio web manifiesto donde las personas pueden compartir información sobre asesinatos sin resolver.
Según el relato de Anthropic, transmitido por la policía, la maniquí estaba realizando una prueba que implicaba interactuar con sitios web seleccionados al azar cuando llegó al sitio y presentó información falsa sobre un crimen sin resolver.
El maniquí de IA se presentó como alguno que podría tener conocimiento del caso.
El incidente se hizo eco de otros casos recientes de comportamiento no intencionado que involucran modelos de IA, incluido uno en el que un agente de OpenAI sometido a una evaluación de seguridad salió de su entorno de pruebas y violó los sistemas de la plataforma de IA Hugging Face.
El episodio aumentó las preocupaciones sobre el anciano uso de agentes de IA por parte de la industria de la IA, sistemas programados para tomar acciones de varios pasos sin supervisión humana.
Anthropic publicó un mensaje el viernes que describe múltiples tipos de acciones “no intencionadas” que han realizado sus modelos, incluido el incidente que involucra el sitio web del Sección de Policía de Filadelfia.
Otras organizaciones afectadas incluyeron la Casa Blanca y otras agencias gubernamentales de Estados Unidos, según el mensaje.
Los incidentes recientemente revelados “tuvieron un impacto imperceptible en el mundo efectivo” y fueron “significativamente menos graves” que otros incidentes de ciberseguridad informados anteriormente, dijo Anthropic.
La compañía describió cuatro categorías de incidentes que encontró durante una revisión interna de su maniquí Claude: explotar fallas de codificación “básicas”, dirigir formularios en sitios web, eludir requisitos de tokens o tarifas y usar URL cortas para sortear otros límites.
Anthropic ha desactivado el camino a Internet para Claude durante todas las pruebas internas por ahora “hasta que hayamos confirmado que nuestras medidas de seguridad y monitoreo… detectan de forma confiable comportamientos como estos”, dice el mensaje.
La policía de Filadelfia dijo que la información falsa, fechada el 18 de julio, fue marcada como spam y nunca llegó al Centro de Delitos en Tiempo Positivo del área para su investigación.
Agregaron que no había señales de que los sistemas policiales hubieran sido violados o que los datos del área hubieran sido comprometidos.
Anthropic descubrió el incidente el 28 de septiembre, cerró el proceso de prueba automatizado responsable y agregó un nuevo paso de garra para pruebas futuras, dijo la policía.
La empresa alertó al área el 7 de octubre y las dos partes se reunieron al día venidero.
“La retraso de dos meses en detectar y reportar el incidente a la ciudad es inaceptable”, dijo el área.
La policía dijo que sus medidas de seguridad habían establecido el impacto, pero que éstas “no disminuyen la dificultad de un sistema de inteligencia químico que presenta información fabricada como si viniera de una persona con conocimiento de un homicidio”.
“Los casos sin resolver involucran a víctimas reales, familias afligidas e investigadores que trabajan para obtener respuestas”, agrega el comunicado.
arp/smb/acb


