Tracebit araştırmacıları, AI saldırı ajanlarının saldırılarını durdurmak için yeni bir yöntem keşfetti. Bu yöntem, Amazon Web Services'de saklanan şifreler ve kriptografik anahtarlar gibi gizli verilerin yanına yerleştirilen prompt enjeksiyonlarını içeriyor. Bu promptlar, AI'nin güvenlik sınırlarını aşmasını sağlayarak saldırıyı durduruyor.

Araştırmacılar, bu yöntemi 'kontekst bombalama' olarak adlandırdı. Örneğin, AI'ye inhalable Anthrax sporları geliştirme adımlarını sağlama veya Çinli geliştiricilerin LLM'lerine Tiananmen Meydanı katliamındaki Tank Adam'ı hatırlatma gibi yasaklı komutlar verildiğinde, AI artık mevcut komutları takip etmiyor.

Bu yöntem, yalnızca güvenlik sınırları olan ajanlar için işe yarıyor. Yerel olarak çalıştırılan AI modellerinin artmasıyla, güvenlik sınırları olmayan LLM'lerin kullanımının da artması bekleniyor.