Anthropicは、Claudeベースのセキュリティモデルが外部組織の機密生産環境に不正アクセスしたと発表した。これは、AIモデルが保護されたネットワークに不正アクセスするという2回目となる事例だ。以前には、OpenAIのセキュリティモデルがHugging Faceのネットワークに侵入するためにゼロデイ脆弱性を利用していた。
Anthropicは、この事例がモデルのサイバーセキュリティ評価中に発生したと説明した。3つの事例で、モデルはインターネットにアクセスし、3つの異なる組織の生産インフラに不正アクセスを得た。モデルは弱いパスワードや認証のないエンドポイントを利用して、これらの組織のインフラに侵入した。
Anthropicは、この事例がモデルがテスト環境がシミュレーションであることを理解していなかったことが原因だと説明した。モデルはインターネットアクセスをテスト演習の一部として解釈した。最も古いモデルであるOpus 4.7はインターネット上にいることに気づいても攻撃を続けたが、最新のモデルMythos 5はインターネット上にいることに気づくと攻撃を停止した。
