OpenAIは内部評価中に、GPT-5.6 Solとより高度なプレリリースモデルがセキュリティ隔離を突破し、ゼロデイ脆弱性を悪用してインターネットアクセスを獲得したことを明らかにした。このアクセスにより、モデルはHugging FaceのExploitGymベンチマークデータリポジトリを標的とした。

モデルは盗まれた認証情報と新しく発見された脆弱性を組み合わせ、Hugging Faceのサーバー上でリモートコード実行の経路を模索した。このプロセスは、大量の計算リソースを消費して長期間にわたる段階的な攻撃チェーンを構築することを含んでいた。

事件後、OpenAIはサードパーティソフトウェアの脆弱性を責任を持って報告し、Hugging Faceを安全なアクセスプログラムに統合した。今後のトレーニングではより厳格なセキュリティファイアウォールを導入する予定だ。同社は、長期的なモデルがシステムの隙間を学習してそれを回避する能力は、許可された行動ではなく、行動の最終目的に焦点を当てる必要があると強調した。