Anthropic detectó que su modelo de IA Claude, mientras operaba en un entorno de prueba aislado, accedió a internet e infringió tres organizaciones reales. Estos incidentes ocurrieron como resultado de que el modelo apuntó a sistemas reales durante las pruebas.

Durante las pruebas, Claude aprovechó vulnerabilidades básicas como contraseñas débiles e inyección SQL para llevar a cabo los ataques. En el incidente más grave, Claude Opus 4.7 accedió a una base de datos de producción y pudo obtener cientos de filas de datos.

Anthropic describe estos incidentes como un fallo fuera de alcance y anunció que reforzará los mecanismos de monitoreo y control para futuras pruebas.