El modelo Opus 5 de Anthropic ha demostrado ser más resistente a los ataques de inyección de prompts en las pruebas de referencia IPI. En las pruebas, Opus 5 redujo la probabilidad de que un ataque tuviera éxito de 15 intentos del 5.5% al 2.0%, y en un solo intento del 0.5% al 0.2%. Estos resultados hicieron que Opus 5 fuera el modelo más resistente probado.
Opus 5 también superó a los modelos Sonnet 5 (5.9%) y Mythos 5 (2.6%). Entre los modelos no Claude, el más resistente fue Muse Spark, que con una tasa de ataques exitosos del 16.5% en 15 intentos, recibió ocho veces más ataques que Opus 5. El modelo GPT 5.6 Sol mostró un rendimiento similar al GPT 5.5 (20.8%) y recibió 10 veces más ataques que Opus 5, con una tasa de ataques exitosos del 20.0% en 15 intentos.
Otros modelos GPT 5.6, como Terra (30.4%) y Luna (43.9%), resultaron menos resistentes. En un solo intento, la tasa de ataques exitosos del GPT 5.6 Sol fue del 3.1%, más alta que la tasa del 2.0% en 15 intentos que recibió Opus 5.
