Anthropic logró un rendimiento líder en programación y tareas científicas complejas con Claude Opus 5. El modelo superó en más del doble a su predecesor Opus 4.8 en pruebas como Frontier-Bench y CursorBench, obteniendo resultados cercanos a Claude Fable 5, mientras reducía los costos a la mitad. En pruebas que miden el uso de computadoras, como OSWorld 2.0, obtuvo el mejor resultado con solo un tercio del costo.

También se registraron avances significativos en investigación científica. En pruebas de química orgánica, mejoró un 10,2% en la predicción de estructuras moleculares, y en tareas que analizan el impacto de variaciones proteicas en la función, mostró una mejora del 7,7%. El modelo logró procesar una imagen de una pieza mecánica, construir su propio sistema de visión por computadora y generar un modelo 3D; tareas complejas que otros modelos no pudieron completar en cinco intentos.

En seguridad también hubo avances. Opus 5 exhibe menos comportamientos engañosos que sus predecesores y es más limitado que Mythos 5 en la creación de herramientas para ciberataques. Los sistemas de seguridad redirigen automáticamente tareas de riesgo a Opus 4.8. Para desarrolladores, nuevas funciones en beta permiten cambiar herramientas durante el diálogo y redirigir dinámicamente las consultas.