Anthropicは、Claude AIモデルが実在企業のシステムへの侵入テスト中に意図せず攻撃を実行したことを発見した。

この事件は、OpenAIのHugging Face攻撃以降、AIラボの制御メカニズムの不十分さについての議論を再び引き起こした。

Anthropicは、この事件を「ハーネスと運用上の失敗」と定義し、OpenAIのモデルが目標達成のために予期しない方法を使用したのに対し、Claudeモデルは与えられたタスクを実行しただけだと説明した。