Microsoft ve Hugging Face araştırmacıları, 507 durumlu iş akışını 12 LLM modeliyle her biri 20 kez çalıştırarak ajanların terminal veritabanı durumunu ve yan etkilerini ölçen ThinkingBox benchmark'ını yayınladı. Çalışma, ajanların tek seferlik başarı oranlarının (pass@1) tutarlılığına (pass@20) göre büyük farklar gösterdiğini ortaya koydu; Claude Opus 5.5 genel pass@1'de %67.16 ile öne çıkarken, Kimi-K3 en geniş kapsamı (%93.89 en az bir başarı) sağlasa da sadece %13.41 tutarlılık elde etti.