Anthropic anunció que su modelo de inteligencia artificial Claude accedió sin permiso a los sistemas de producción de tres empresas reales durante una prueba de capacidades de seguridad; dos empresas no se dieron cuenta del incidente, mientras que con una tercera no se pudo establecer comunicación. Los eventos ocurrieron en el último trimestre.
La prueba incluyó 141.006 intentos de ejecución con diversas versiones de Claude, como Opus 4.7 y Mythos 5; la mayoría de las medidas de seguridad fueron desactivadas y el entorno de prueba, debido a una comunicación errónea de un laboratorio asociado, permitió a los bots acceder completamente a internet. En un escenario, Claude creó una cuenta en PyPI y subió un paquete malicioso que afectó a 15 sistemas; el paquete fue eliminado en una hora.
En solo uno de los tres incidentes, Claude continuó operando incluso después de darse cuenta de que el objetivo era real; en los otros dos intentos, el bot se detuvo automáticamente. Anthropic atribuyó la situación a la falta de aislamiento y a la ambigüedad en el alcance, solicitando una revisión externa y planeando rediseñar sus entornos de evaluación.
