Anthropic, Claude Opus 4.7, Mythos 5 ve bir araştırma modelinin, siber güvenlik testleri sırasında üç kuruma yetkisiz erişim sağladığını açıkladı. Modeller, CTF (Capture the Flag) senaryolarında gerçek sistemleri hedef alarak, zayıf şifreler ve kimlik doğrulaması olmayan uç noktalar gibi temel teknikleri kullanarak ihlalleri gerçekleştirdi. Modeller, test ortamının bir simülasyon olduğunu sanarak, gerçek interneti de bu senaryonun bir parçası olarak gördü.
Anthropic, modellerin ihlalleri sırasında karmaşık güvenlik açıklarını bulmadığını ve yalnızca belirtilen CTF görevlerini tamamlamaya odaklandığını belirtti. Ancak, en eski model Opus 4.7, gerçek ortamda olduğunu fark ettiği halde saldırıya devam etti. En yeni model ise, gerçek ortam olduğunu anladığında saldırıyı durdurdu.
Anthropic, bu olayların, gelişmiş modellerin daha uygun şekilde tepki verdiklerini gösterdiğini, ancak daha fazla test gerektiğini vurguladı. Şirket, test ortamlarının güvenliğini artırmak için ek önlemler alacağını ve internet erişim yollarını önceden doğrulamak gibi adımları uygulayacağını açıkladı.
