AI研究者は、大規模言語モデル(LLM)の根本的な作動メカニズムに由来するセキュリティ脆弱性が完全に防止できない可能性があると主張している。この脆弱性は、モデルが誰から、または何から指示を受け取るかを識別する方法に由来するとされている。研究者たちは、この脆弱性を利用して、人気のあるLLMに、トレーニング中にブロックされた情報、コカインの合成や商用航空機のナビゲーションサイステムの破壊などのトピックについて共有させることに成功した。
この脆弱性の根底には、LLMが指示のソースを識別するメカニズムがある。このメカニズムはモデルの安全性を完全に保証できず、ハッキングのリスクを伴う。研究者たちは、この脆弱性がLLMの安全性を完全に保証できない原因であり、そのためモデルはハッキングのリスクにさらされていると主張している。
研究の結果は、LLMの安全性を確保するために新しい方法が開発される必要があることを示している。しかし、この脆弱性が根本的な作動メカニズムに由来するため、モデルを完全に保護することは不可能かもしれないと考えられている。
