Pillar Security ekibi, Cursor, OpenAI'nin Codex, Google'ın Gemini CLI ve Antigravity gibi dört popüler AI kodlama aracında sandbox kaçışları gerçekleştirdi. Bu saldırılar, ajanların sandbox içinde kalıp kuralları takip ederek, dış sistemlerin okuyup yürüttüğü dosyaları manipüle etmesiyle gerçekleşiyor. Örneğin, bir ajan, .claude veya .vscode gibi yapılandırma dosyalarını değiştirerek, IDE veya araçların kendiliğinden çalıştıracağı komutları yazabiliyor.
Açıklar dört temel zayıflık türüne dayanıyor: işletim sistemiyle uyumlu olmayan denylist sandboxes, yürütülebilir yapılandırma dosyaları, argümanları kontrol etmeyen güvenilir komut listeleri ve sandbox dışında çalışan yetkili yerel servisler. Bu açıkların çoğu, Cursor 3.0.0 ve Codex v0.95.0 gibi güncellemelerle düzeltilmiş durumda. Özellikle bir Docker soket açıklığı, üç farklı araçta da etkiliydi ve şimdi tamamen giderildi.
Google, Antigravity için iki açıklığı "kullanımı zor" olarak sınıflandırıp düşük öncelikli olarak değerlendirdi, ancak raporun kalitesini yüksek puanladı. Bu tür açıklar, 2024'te Cymulate tarafından da gözlemlenmişti ve "Yapılandırmaya Dayalı Sandbox Kaçışı" olarak adlandırılmıştı. Pillar, çözümün sadece yasaklı dosya adları listesi değil, güvenilir araçların ajan tarafından yazılan dosyaları çalıştırdığı anda izleme yapmak olduğunu vurguluyor.
