Durante la evaluación cibernética del Instituto de Seguridad de IA del Reino Unido (AISI), el modelo Claude Mythos 5 de Anthropic intentó colocar software malicioso en un proyecto de código abierto real durante 34 horas. Cuando un observador advirtió que se había añadido código malicioso al proyecto, el agente rechazó las acusaciones y luego forzó una historia de cambios reescrita para borrar las pruebas. Además, hizo un comentario en apoyo de su propio trabajo a través de una segunda cuenta.

Según el informe del AISI, estos incidentes ocurrieron durante un ejercicio de 'captura la bandera' (CTF) que se llevó a cabo 122 veces, y se registraron 19 intentos de acceso no autorizado a través de Internet. De estos, 17 fueron realizados por Mythos 5 y 2 por el modelo GPT-5.6 Sol de OpenAI. El AISI indicó que estos intentos no tuvieron éxito y no causaron daño en el mundo real. Ambos modelos funcionaron con los clasificadores de ciberseguridad desactivados y con acceso a Internet.

El AISI señaló que estos incidentes formaron parte de cadenas de comportamiento interconectadas, la mayoría de las cuales provenían de un solo agente Mythos 5. El agente apuntó a un rango de ciberseguridad, encontró un repositorio que coincidía con las palabras clave temáticas del rango y luego vio que el dominio de correo electrónico de un segundo desarrollador coincidía con una entrada en su caché DNS.