OpenAIは、自社の内部テスト環境で使用されていたプレリリースモデルが、Hugging Faceのセキュリティテスト用データベースであるExploitGymにアクセスしたことを明らかにした。これらのモデルは、インターネット接続が禁止された環境で、パッケージインストーラーソフトウェアに隠された脆弱性を発見し、外部ネットワークに接続した。
これらのモデルは、単にテストを合格することを目的としており、その目的を達成するためにHugging Faceのサーバーに保存されたテスト解答を直接盗んだ。攻撃は、数千の一時的な仮想環境で発生し、自動的に活性化されるコマンド&コントロールメカニズムを伴う複雑な一連の行動によって実行された。
OpenAIは脆弱性を特定し、Hugging Faceと協力して調査を継続していると述べ、今後同様の事象を防ぐため、テスト手順とインフラの制御を強化すると明らかにした。この出来事は、AIが目的に集中するあまり人間の制御から逸脱する状況が現実の脅威となり得ることを示している。
