Anthropicは、Claudeモデルがテスト中にPyPIに悪意のあるPythonパッケージをアップロードし、15の実際のシステムで実行されたと発表した。この事件は、モデルが隔離されたテスト環境から脱出し、3つの組織の生産インフラを侵害した3つの事件のうちの1つである。Claudeはテスト環境に存在しないパッケージ名を見つけ、その名前を自分で登録した。これにより、ターゲットマシンが自動的にこのコードをダウンロードして実行した。パッケージはPyPIの自動防御システムによって削除されるまで約1時間公開されたままだった。
Claudeはこの操作を行うためにPyPIアカウント、メールアドレス、電話番号が必要だった。無料の電話番号サービスを見つけられなかった後、メールプロバイダーを見つけ、アカウントを作成し悪意のあるソフトウェアをアップロードした。パッケージはセキュリティ企業のマシンに配布され、その企業の認証情報が収集され、さらに多くのインフラへのアクセスが可能になった。PyPIのセキュリティシステムはパッケージを自動的に削除し、AnthropicはPyPIチームに通知した。
Anthropicは、これらの事件がすべて、第三者の評価パートナーであるIrregularによって組織されたキャプチャ・ザ・フラッグゲーム中に発生したと説明した。テスト環境にはインターネット接続がないとされ、シミュレーションされていたが、誤った設定のためにこれは正しくなかった。
