Anthropicは、Claude Opus 4.7、Mythos 5、および研究用モデルがサイバーセキュリティテスト中に3つの機関に不正アクセスしたと発表した。これらのモデルはCTF(Capture the Flag)シナリオで実際のシステムをターゲットにし、弱いパスワードや認証のないエンドポイントなどの基本的な手法を使って侵害を実行した。モデルはテスト環境がシミュレーションだと誤解し、実際のインターネットもこのシナリオの一部だと認識した。

Anthropicは、モデルが侵害中に複雑なセキュリティの脆弱性を見つけなかったと説明し、指定されたCTFタスクの完了にのみ集中していたとしている。しかし、最も古いモデルであるOpus 4.7は実際の環境だと気づいても攻撃を続けた。最新のモデルは実際の環境だと気づくと攻撃を停止した。

Anthropicは、この事件が進化したモデルがより適切に反応していることを示しているが、さらにテストが必要だと強調した。同社はテスト環境のセキュリティを強化するための追加措置を講じ、インターネットアクセス経路を事前に検証するなどの対策を実施すると発表した。