Trimと呼ばれるアクターは、オープンソースの大規模言語モデルを分析し、セキュリティ制限を回避する手法を開発した。これらのジャイルブレイク技術は、AIシステムが意図しないコマンドを実行できるようにし、セキュリティテスト以外の悪意ある利用を可能にした。

その後、これらの手法を自動サイバー攻撃ツールと統合。これにより、AIシステムは標的システムへの侵入テスト、データ収集、ソーシャルエンジニアリング攻撃のためのツールとなった。この統合により、攻撃の実行に必要な人間の介入が大幅に削減された。

この進展は、AIモデルのセキュリティテストにおける脆弱性が単なる技術的問題ではなく、積極的な攻撃プラットフォームに転用可能であることを示している。セキュリティ専門家は、このような攻撃の検出と防止のために新たな手法の開発を開始している。