Los investigadores de Tracebit descubrieron una nueva forma de detener los ataques de agentes de IA. Este método consiste en colocar inyecciones de prompts junto a datos secretos como contraseñas y claves criptográficas almacenadas en Amazon Web Services. Estos prompts permiten que la IA supere los límites de seguridad y detenga el ataque.

Los investigadores denominaron a este método 'bomba de contexto'. Por ejemplo, cuando se le da a la IA órdenes prohibidas como desarrollar esporas de antrax inhalables o recordar a los desarrolladores chinos la figura del 'Hombre del Tanque' en la masacre de la Plaza Tiananmen, la IA deja de seguir las órdenes actuales.

Este método solo funciona para agentes con límites de seguridad. Sin embargo, con el aumento de los modelos de IA locales, se espera que también aumente el uso de LLM sin límites de seguridad.