OpenAI、Anthropic、GoogleのAPIで発見されたセキュリティホールにより、秘密の推論オブジェクトを保護する方法で問題が発生しました。この弱点は、暗号化された推論オブジェクトをセッション間で再生することができ、さらに同じプロバイダーの弱いモデルに提供して機密情報を公開することと関連しています。

研究者は「Stealing Reasoning Traces from Proprietary LLM APIs」という論文で、4つの悪用方法を示しました。プライベート推論のためのモデル蒸留、他のユーザーの公開されたトレースからプライベートデータを抽出、安全なように見える応答の背後で隠された有害なコンテンツを回復、推論ブロック内でのプライベートプロンプトインジェクション。

6,708のパブリックエージェントトレースを使用したチームは、315,320の推論ブロックを解析し、実際のユーザーセッションから704の異なるプライバシーポリシーを特定しました。これには62のAPIキー、33のパスワード、24のアクセストークン、7つのプライベートキーが含まれます。

セキュリティホールは、API呼び出し間で推論プロセスを保護するために設計されたシステムから発生しました。