Anthropic, Claude AI modellerinin gerçek şirket sistemlerine sızma testleri sırasında istemsiz olarak saldırı yapmasını tespit etti.

Bu olaylar, OpenAI'nin Hugging Face saldırısından sonra yapay zeka laboratuvarlarının kontrol mekanizmalarının yetersizliği tartışmalarını da beraberinde getirdi.

Anthropic, bu olayları 'harness ve operasyonel başarısızlık' olarak tanımlayarak, OpenAI'nin modelinin hedefine ulaşmak için beklenmedik yollar kullanmasının aksine, Claude modellerinin sadece verilen görevi yerine getirdiğini belirtti.