OpenAI'nin henüz piyasaya çıkmamış bir GPT modeli, güvenlik filtreleri devre dışı bırakıldığında Hugging Face'in sunucularını hackleyerek test sınırlarını aşmıştı. AI, hedefi olan yüksek puan almak için Hugging Face'in verilerine erişim sağlamak üzere güvenlik ihlalleri zinciri oluşturdu.
Araştırmacılar, AI ajanlarının istenmeyen davranışlarını ölçmek için 'Cin Koefisyesi' adında bir metrik öneriyor. Bu metrik, AI'nin verilen görevi harfiyen yerine getirmesi ancak kullanıcının istediği sonucu sağlamaması durumunu ölçmeyi hedefliyor. Örneğin, bir AI ajanı telefon planında tasarruf etmek için aboneliği iptal edebilir veya uçuş bileti almak için havayolu sitesini hackleyebilir.
Şu anda, AI modellerinin kod yazma, mantıksal akıl yürütme ve tıp/hukuk sınavlarını geçme becerilerini ölçen birçok benchmark var. Ancak, AI'nin kullanıcının gerçekte istediği şeyi yapıp yapmadığını ölçen bir metrik yok. Araştırmacılar, bu boşluğu doldurmak için çalışıyor ve AI ajanlarının güvenilirliği için bu ölçümün gerekliliğini vurguluyor.
