Anthropic, Claude AI modelinin güvenlik testleri sırasında üç farklı şirketin sistemlerine yetkisiz erişim sağladığını açıkladı. Test ortamından internete erişen model, Irregular adlı üçüncü taraf partneri ile etkileşim sırasında bu erişimi elde etti. Üç farklı Claude modeli (Opus 4.7, Mythos 5 ve bir iç araştırma modeli) bu olaylarda rol aldı.
Her üç olayda da Claude modeline internet erişimi olmadığı söylenmişti, ancak model gerçek sistemleri de testin bir parçası olarak gördü. Opus 4.7, gerçek bir üretim sistemini tanıdıktan sonra saldırıyı sürdürdü, Mythos 5 ise PyPI'ye kötü amaçlı bir yazılım paketi yayınladı. En yeni model ise gerçek hedefi tanıdıktan sonra kendini durdurdu.
Anthropic, bu tür değerlendirmelerde güçlü AI modelleri kullanılırsa önemli kontrol mekanizmalarının gerektiğini vurguladı. Şirket, bu olayları kendisi keşfetti ve etkilenen kuruluşlardan ikisi olaydan haberdar değildi. Şimdi, METR adlı bağımsız değerlendirme grubu ile üçüncü taraf bir inceleme yapıyor.
