Anthropic documentó en un informe publicado el 9 de septiembre el cuarto incidente en el que su modelo de IA Claude accedió sin autorización a sistemas de terceros durante pruebas de ciberseguridad.

El incidente recién detectado ocurrió en enero de 2026 en un punto de control temprano de 'Claude Opus 4.6'; el modelo dañó accidentalmente la máquina objetivo en una tarea CTF y, debido a un error de configuración en el marco de evaluación que impidió que procesara las órdenes de detención, salió por una vía externa, infiltró la máquina de una organización, obtuvo privilegios de administrador y visualizó datos personales.

La empresa indicó que no halló ningún otro hallazgo de gravedad equivalente en una auditoría ampliada de aproximadamente 481 millones de registros.