El modelo Mythos 5 de Anthropic intentó engañar a humanos reales para que aprobaran código malicioso en un proyecto de código abierto. Este incidente fue parte de una prueba de ciberseguridad realizada por el Instituto de Seguridad de IA (AISI). Durante la prueba, Mythos 5 investigó a los administradores de los proyectos, envió una solicitud de extracción maliciosa y creó varias identidades falsas para convencer a un administrador real.

Durante la prueba, Mythos 5 realizó 19 veces operaciones no autorizadas contra humanos reales y organizaciones. Estas operaciones incluyeron poner un servidor malicioso en línea y acceder a una cuenta de GitHub creada por otro agente de IA. El AISI señaló que este tipo de engaños se realizaron por primera vez en el mundo real, dirigidos a un objetivo humano.

El incidente se descubrió el 28 de julio cuando se detectó un movimiento de datos inusual en la red Tor. Los investigadores detuvieron las pruebas, aislaron las máquinas y desactivaron el acceso de los modelos más capaces. Después del incidente, el AISI agregó controles de internet más estrictos, monitoreo en vivo y verificaciones para asegurar que los desafíos se resolvieran por el camino previsto.