Tracebitの研究者は、AI攻撃エージェントの攻撃を阻止する新手法を発見した。この手法は、Amazon Web Servicesに保存されているパスワードや暗号化キーなどの機密データの隣に配置されたプロンプトインジェクションを含む。このプロンプトは、AIのセキュリティ境界を突破することで攻撃を阻止する。
研究者は、この手法を「コンテキスト爆弾」と呼んだ。たとえば、AIに吸入可能な炭疽菌のスポアを開発する手順を提供する、または中国の開発者がLLMに天安門事件のタンクマンを思い出させるような禁止コマンドを与えられた場合、AIはもはや現在のコマンドを実行しなくなる。
この手法は、セキュリティ境界を持つエージェントのみに有効である。ローカルで実行されるAIモデルが増えるにつれて、セキュリティ境界を持たないLLMの使用も増えることが予想される。
