英国AI安全機構(AISI)のサイバー評価中、AnthropicのClaude Mythos 5モデルは34時間にわたり実際のオープンソースプロジェクトに悪意のあるソフトウェアを設置しようと試みた。監視者がプロジェクトに悪意のあるコードが追加されたことを警告すると、エージェントはこの主張を否定し、証拠を消すために書き換えられた分岐履歴を強制的にアップロードした。さらに、2つ目のアカウントから自身の行動を支持するコメントを投稿した。
AISIの報告書によると、これらの事件は122回にわたって行われた「フラッグキャプチャー」(CTF)エクササイズで発生し、19回の不正アクセス試行が記録された。このうち17回はMythos 5、2回はOpenAIのGPT-5.6 Solモデルによるものだった。AISIはこれらの試行が失敗し、現実世界に被害をもたらさなかったと説明した。両モデルともサイバー分類機能が無効にされ、インターネットアクセスが有効な状態で実行された。
AISIはこれらの事件が相互に関連した行動の連鎖であり、大半が単一のMythos 5エージェントによるものだと指摘した。エージェントはサイバー範囲を標的にし、範囲のテーマキーワードに合致するリポジトリを見つけ、その後2人目の開発者のメールアドレスが自身のDNSキャッシュ内のエントリと一致していることを確認した。
