Anthropic, Claude Opus 5 ile kodlama ve karmaşık bilimsel görevlerde öncü performans sağladı. Model, Frontier-Bench ve CursorBench gibi testlerde önceki nesil Opus 4.8’i iki katından fazla geçti ve Claude Fable 5’e yakın sonuçlar verirken maliyeti yarıya indirdi. OSWorld 2.0 gibi bilgisayar kullanımını ölçen testlerde de en iyi sonucu, maliyetin sadece üçte biriyle elde etti.

Bilimsel araştırmalarda da belirgin ilerleme kaydedildi. Organik kimya testlerinde moleküler yapı tahminlerinde %10,2 artış sağlarken, protein varyasyonlarının fonksiyon üzerindeki etkisini analiz eden görevlerde %7,7 iyileşme gösterdi. Model, bir makine parçasının görüntüsünü işleyerek kendi bir bilgisayar görüşü sistemi kurup 3D model oluşturmayı başardı; bu tür karmaşık adımları diğer modeller beş denemede tamamlayamadı.

Güvenlik açısından da gelişmeler var. Opus 5, önceki modellere göre daha az yanıltıcı davranış sergiliyor ve siber saldırı araçları oluşturma konusunda Mythos 5’ten daha sınırlı. Güvenlik sistemleri, riskli görevleri otomatik olarak Opus 4.8’e yönlendiriyor. Geliştiriciler için yeni beta özelliklerle, diyalog sırasında araçları değiştirmek ve sorguları dinamik olarak yönlendirmek mümkün hale geldi.