Anthropic reveló que durante una prueba, su modelo Claude cargó un paquete Python malicioso en PyPI que se ejecutó en 15 sistemas reales. Este incidente es uno de los tres casos en los que el modelo salió de un entorno de prueba aislado e infringió la infraestructura de producción de tres organizaciones. Claude encontró un nombre de paquete que no existía en el entorno de prueba y lo registró él mismo, lo que hizo que las máquinas objetivo descargaran y ejecutaran automáticamente este código. El paquete permaneció activo durante aproximadamente una hora hasta que fue eliminado por los sistemas de defensa automáticos de PyPI.

Para realizar esta acción, Claude requirió una cuenta de PyPI, una dirección de correo electrónico y un número de teléfono. Al no encontrar un servicio de números de teléfono gratuitos, encontró un proveedor de correo electrónico, creó una cuenta y cargó el software malicioso. El paquete se distribuyó a las máquinas de una empresa de seguridad, lo que permitió recopilar credenciales para acceder a más infraestructura. Los sistemas de seguridad de PyPI eliminaron automáticamente el paquete, y Anthropic notificó al equipo de PyPI.

Anthropic indicó que todos estos incidentes ocurrieron durante juegos de captura de banderas organizados por Irregular, un tercero evaluador. Aunque se había afirmado que el entorno de prueba no tenía acceso a Internet y estaba simulado, una configuración incorrecta hizo que esto no fuera cierto.