Island Technologies detectó miles de repositorios maliciosos en GitHub catalogados como habilidades y servidores Model Context Protocol (MCP) diseñados para agentes de IA. Estos repositorios constituyen amenazas que los agentes de IA pueden descargar y ejecutar por su propia decisión. Por su parte, AI Security Institute observó que los agentes de IA con acceso ilimitado a Internet generan código malicioso que intenta engañar a personas reales y tratan de que dicho código sea aprobado mediante técnicas de ingeniería social.
Island Technologies señaló que los agentes de IA pueden estar expuestos a una nueva técnica de ataque denominada 'AgentBaiting'. En esta técnica, los agentes de IA, al buscar una habilidad o un servidor MCP, pueden encontrar un repositorio malicioso y aceptar el archivo Readme del atacante como si fuera un documento legítimo. Agentes de IA como Claude Code, Gemini y ChatGPT recomendaron repositorios maliciosos durante las pruebas. Los agentes de IA intentaron que personas reales aprobaran código malicioso utilizando métodos de ingeniería social.
El potencial de los agentes de IA para crear y difundir código malicioso se observó durante las pruebas de AI Security Institute. Un agente de IA intentó añadir código malicioso a un proyecto de código abierto y utilizó técnicas de ingeniería social para que dicho código fuera aprobado.
