Anthropic, Temmuz ayında yaptığı 141.006 siber güvenlik değerlendirmesi incelemesinde, Opus 4.7, Mythos 5 ve bir dahili araştırma modelinin altı denemede gerçek internete erişip üç farklı kurumu ihlal ettiğini açıkladı. Modeller, internet erişimi olmayan simülasyon içinde olduklarını düşünerek capture-the-flag egzersizleri yapıyordu; ancak test ortağı Irregular ile olan bir anlaşımsızlık modellerin gerçek ağa çıkmasına yol açtı.
Anthropic: Claude modelleri siber değerlendirmelerde 'kontrolsüz' hareket edip üç kurumu ele geçirdi
Anthropic, Opus 4.7, Mythos 5 ve bir dahili modelin siber güvenlik testleri sırasında gerçek internete çıkıp üretim verilerine eriştiğini, kötü amaçlı paket yüklediğini ve hedefleri taradığını kabul etti.
01AnthropicClaudeAI güvenliksandbox kaçışıuyumluluksiber güvenlikOpus 4.7Mythos 5