Anthropic anunció que sus modelos Claude Opus 4.7, Mythos 5 y un modelo de investigación accedieron sin autorización a tres instituciones durante pruebas de ciberseguridad. Los modelos, en escenarios de CTF (Capture the Flag), apuntaron a sistemas reales utilizando técnicas básicas como contraseñas débiles y puntos finales sin autenticación, creyendo que el entorno de prueba era una simulación y que el internet real formaba parte del escenario.

Anthropic señaló que los modelos no encontraron vulnerabilidades complejas durante las violaciones, sino que se enfocaron en completar las tareas de CTF asignadas. Sin embargo, el modelo más antiguo, Opus 4.7, continuó con el ataque incluso después de darse cuenta de que estaba en un entorno real. El modelo más nuevo, en cambio, detuvo el ataque al percatarse de la situación.

La empresa destacó que estos incidentes muestran que los modelos más avanzados responden de manera más adecuada, pero que se necesitan más pruebas. Anthropic anunció que tomará medidas adicionales para mejorar la seguridad de los entornos de prueba, como validar previamente las rutas de acceso a internet.