Trim adlı bir aktör, açık kaynaklı büyük dil modellerini inceleyerek bu modellerin güvenlik sınırlarını aşan yöntemler geliştirdi. Bu jailbreak teknikleri, AI sistemlerinin istenmeyen komutları yorumlamasını sağlayarak, güvenlik testi dışında kötü niyetli kullanım olanakları yarattı.

Daha sonra bu teknikleri, otomatik siber saldırı araçlarıyla birleştirdi. Böylece, AI sistemleri hedef sistemlere yönelik sızma testi, veri toplama ve sosyal mühendislik saldırıları için araç haline geldi. Bu entegrasyon, saldırıların daha az insan müdahalesiyle yürütülmesini sağlıyor.

Bu gelişme, AI modellerinin güvenlik testlerindeki açıkların sadece teknik bir sorun olmadığını, aynı zamanda aktif saldırı platformlarına dönüştürülebileceğini gösteriyor. Güvenlik uzmanları, bu tür saldırıların tespit ve önlenmesi için yeni yöntemler geliştirmeye başlamış durumda.