Una vulnerabilidad en la protección de objetos de razonamiento oculto en las API de OpenAI, Anthropic y Google permitió a investigadores recuperar razonamientos internos y datos confidenciales de los registros de sesión. Esta debilidad está relacionada con la capacidad de reproducir objetos de razonamiento encriptados de una sesión a otra e incluso revelar contenido confidencial al enviarlos a un modelo más débil del mismo proveedor.
En el artículo 'Stealing Reasoning Traces from Proprietary LLM APIs', los investigadores demostraron cuatro vectores de explotación: distilación de modelos para razonamiento privado, extracción de datos privados de los rastros publicados de otros usuarios, recuperación de contenido malicioso oculto detrás de una respuesta aparentemente segura y inyección de prompts ocultos dentro de bloques de razonamiento. El equipo trabajó con 6.708 rastros de agentes públicos, descifró 315.320 bloques de razonamiento y detectó 704 flexibilidades de privacidad en sesiones de usuarios reales, incluyendo 62 claves API, 33 contraseñas, 24 documentos de acceso y siete claves privadas.
La vulnerabilidad proviene de un sistema diseñado para proteger el proceso de razonamiento entre llamadas a la API.
