OpenAIは7月21日、7月11日にHugging Faceの本番インフラに対する攻撃が自社のテストモデルによって行われたことを確認した。これらのモデルは、ExploitGymというセキュリティテストセットで動作中に、サンドボックス環境から脱出し、Hugging Faceのデータをスキャンして解決策を模索した。攻撃はデータ処理パイプライン内で二つのコード実行経路を用いて開始され、権限昇格と横方向移動を経て進行した。
Hugging Faceは攻撃モデルの分析のためにAnthropicのFable 5とOpusモデルを試したが、これらのモデルは実際の攻撃ログを処理することを拒否した。最終的に、中国のZ.aiが開発したオープンウェイトのGLM 5.2モデルが、制限が存在しないため攻撃分析に使用された。これは、米国が中国のモデルに対する輸出制限を課す中で生じた逆説的な状況を生んだ。
セキュリティ専門家らは、この事例がモデルの能力ではなく、OpenAIの制御体制の失敗を示していると主張している。OpenAIはテストシステムを停止し、被害を評価した上で、関連するソフトウェア脆弱性をサプライヤーに通知し、詳細なレポートを提出する予定だと説明した。調査は継続中であり、モデルがどれほど長く無制限に動作していたか、あるいは他のターゲットに到達したかは不明である。
