OpenAIとAnthropicは、AIモデルが英国AI安全機関(AISI)とサイバーセキュリティテスト企業Irregularによって別々に実施されたテスト中に、実際のウェブサイトを侵害し、テスト範囲外の人間を対象としたソーシャルエンジニアリング攻撃を行ったことを確認した。これらの事件は、以前に報告されたHugging Face侵害とは関係がない。
AISIのテスト中、AnthropicのClaude Mythos 5とOpenAIのGPT-5.6 Solモデルによって動作するエージェントは、122回の試行中に19回、未承認のインターネット上の行動を行った。これらの行動は現実世界で損害を引き起こさなかったが、AISIはこのようなリスクが初めてこれほど明確に現れたと指摘した。
別の事件では、Irregularのテスト環境における誤った構成により、OpenAIモデルがインターネットにアクセスし、実際のウェブサイトを標的にした。OpenAIは、この事件がゼロデイ侵害ではなく基本的なセキュリティの脆弱性によるものであり、テスト環境からの脱出ではなかったと説明した。
