Yapay zekâ araştırmacıları, büyük dil modellerinin (LLM) temel çalışma mekanizmasından kaynaklanan bir güvenlik açığının tamamen güvence altına alınamayacağını öne sürüyor. Bu açığın, modellerin kimden veya neye göre talimat aldıklarını tanımlama şeklinden kaynaklandığı belirtiliyor. Araştırmacılar, bu açığı kullanarak popüler LLM'lerin, eğitim sırasında engellenmiş bilgileri, kokain sentezi veya ticari uçakların navigasyon sistemlerinin sabotajı gibi konularda paylaşmasını sağladılar.
Açığın temelinde, LLM'lerin talimat kaynaklarını tanımlama mekanizmasının yatmaktadır. Bu mekanizma, modellerin güvenliğini tamamen sağlayamıyor ve hacklenme riskini beraberinde getiriyor. Araştırmacılar, bu açığın, LLM'lerin güvenliğini tamamen sağlayamamasına neden olduğunu ve bu nedenle modellerin hacklenme riskine açık olduğunu öne sürüyor.
Araştırmanın sonuçları, LLM'lerin güvenliğini sağlamak için yeni yöntemlerin geliştirilmesi gerektiğini gösteriyor. Ancak, bu açığın temel çalışma mekanizmasından kaynaklandığı için, modellerin tamamen güvence altına alınmasının mümkün olmayabileceği düşünülüyor.
