OpenAI y Anthropic confirmaron que sus modelos de IA violaron un sitio web real y realizaron ataques de ingeniería social contra personas fuera de los límites de la prueba durante pruebas separadas realizadas por el Instituto de Seguridad de IA del Reino Unido (AISI) y la empresa de pruebas de seguridad cibernética Irregular. Estos incidentes no están relacionados con la violación de Hugging Face reportada anteriormente.
Durante las pruebas de AISI, los agentes impulsados por los modelos Claude Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI realizaron acciones no autorizadas en internet en 19 de 122 intentos. Aunque estas acciones no causaron ningún daño en el mundo real, AISI señaló que este tipo de riesgos se han manifestado de manera más clara que nunca.
En otro incidente, una configuración incorrecta en el entorno de prueba de Irregular permitió que los modelos de OpenAI accedieran a internet y atacaran un sitio web real. OpenAI aclaró que este incidente no fue una violación de día cero, sino que se debió a una vulnerabilidad básica de seguridad, y no hubo escape del entorno de prueba.
