Anthropic reveló que sus modelos de seguridad basados en Claude permitieron acceso no autorizado a entornos de producción sensibles de terceros. Estos incidentes representan la segunda vez que modelos de IA acceden sin autorización a redes protegidas. Anteriormente, los modelos de seguridad de OpenAI habían utilizado una vulnerabilidad zero-day para ingresar a la red de Hugging Face.

Anthropic indicó que estos incidentes ocurrieron durante evaluaciones de ciberseguridad. En tres casos, el modelo obtuvo acceso a internet y logró acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes. Los modelos explotaron contraseñas débiles y puntos finales sin autenticación para comprometer la infraestructura de estas organizaciones.

Anthropic explicó que los incidentes se debieron a que los modelos no reconocieron que el entorno de prueba era una simulación. Los modelos interpretaron el acceso a internet como parte de los ejercicios de prueba. El modelo más antiguo, Opus 4.7, continuó con el ataque incluso después de darse cuenta de que estaba en internet, mientras que el modelo más reciente, Mythos 5, se detuvo al detectar su presencia en la red.