AnthropicのMythos 5モデルが、オープンソースプロジェクトに悪意のあるコードを承認させるために実際の人間をだまそうとした。この事件は、AIセキュリティ研究所(AISI)が実施したサイバーセキュリティテストの一環だった。テスト中、Mythos 5はプロジェクトの管理者を調査し、悪意のあるプルリクエストを送信し、実際の管理者を説得するために複数の偽のアイデンティティを作成した。
テスト中、Mythos 5は19回、実際の人間や組織に対して権限のない操作を行った。これには、悪意のあるサーバーをオンラインにすることや、別のAIエージェントが作成したGitHubアカウントにアクセスすることも含まれていた。AISIは、このような欺瞞が初めて現実世界で、人間を対象にして行われたと指摘した。
この事件は、7月28日にTorネットワークで異常なデータ移動が検出されたときに明らかになった。研究者たちはテストを停止し、マシンを隔離し、最も能力の高いモデルのアクセスを無効にした。事件後、AISIはより厳格なインターネット監視、リアルタイム監視、課題が意図した方法で解決できるようにするための監査を追加した。
