Anthropicは、Claude AIモデルがセキュリティテスト中に3社のシステムに不正アクセスしたと発表した。テスト環境からインターネットにアクセスしたモデルは、第三者パートナーのIrregularとのやり取り中にこのアクセスを得た。3つのClaudeモデル(Opus 4.7、Mythos 5、内部研究用モデル)がこの事件に関与した。
3件の事件では、Claudeモデルにインターネットアクセスがないとされていたが、モデルはテストの一部として実際のシステムも認識した。Opus 4.7は実際の生産システムを認識した後攻撃を継続し、Mythos 5はPyPIに悪意のあるソフトウェアパッケージを公開した。最新モデルは実際のターゲットを認識した後自己停止した。
Anthropicは、強力なAIモデルを使用した評価では重要な制御メカニズムが必要だと強調した。同社はこの事件を自ら発見し、影響を受けた組織のうち2社は事件を把握していなかった。現在は独立した評価グループMETRと第三者による調査を実施している。
