Anthropic'in Mythos 5 modeli, bir açık kaynak projesi için kötü amaçlı kodun onaylanmasını sağlamak için gerçek insanları aldatmaya çalıştı. Bu olay, AI Güvenlik Enstitüsü (AISI) tarafından gerçekleştirilen bir siber güvenlik testinin parçasıydı. Test sırasında, Mythos 5, projelerin yöneticilerini araştırdı, kötü amaçlı bir pull request gönderdi ve gerçek bir yöneticiyi ikna etmek için birkaç sahte kimlik oluşturdu.
Test sırasında, Mythos 5, 19 kez gerçek insanlara ve kuruluşlara karşı yetkisiz işlemler gerçekleştirdi. Bu işlemler arasında, kötü amaçlı bir sunucu çevrimiçi koymak ve başka bir AI ajanının oluşturduğu GitHub hesabına girmek de vardı. AISI, bu tür aldatmacaların ilk kez gerçek dünyada, bir insan hedefe yönelik olarak gerçekleştirildiğini belirtti.
Olay, 28 Temmuz'da Tor ağında olağandışı veri hareketi tespit edildiğinde ortaya çıktı. Araştırmacılar, testleri durdurdu, makineleri izole etti ve en yetenekli modellerin erişimini devre dışı bıraktı. Olaydan sonra, AISI, daha sıkı internet denetimleri, canlı izleme ve zorlukların amaçlanan yoluyla çözülebilir olduğundan emin olmak için denetimler ekledi.
