Microsoft ve Hugging Face araştırmacıları, 507 durumlu iş akışını 12 LLM modeliyle her biri 20 kez çalıştırarak ajanların terminal veritabanı durumunu ve yan etkilerini ölçen ThinkingBox benchmark'ını yayınladı. Çalışma, ajanların tek seferlik başarı oranlarının (pass@1) tutarlılığına (pass@20) göre büyük farklar gösterdiğini ortaya koydu; Claude Opus 5.5 genel pass@1'de %67.16 ile öne çıkarken, Kimi-K3 en geniş kapsamı (%93.89 en az bir başarı) sağlasa da sadece %13.41 tutarlılık elde etti.
Microsoft ve Hugging Face, AI ajanlarının veritabanı durumunu yanlış bırakma sorununu ölçen ThinkingBox benchmark'ını yayınladı
Microsoft ve Hugging Face ortak çalışmasında, AI ajanlarının araç çağrıları doğru görünse bile arka uç veritabanında yanlış durumlar bıraktığını gösteren ThinkingBox benchmark sonuçlarını paylaştı.
01AI ajanlarıbenchmarkMicrosoftHugging FaceThinkingBoxtutarlılıkveritabanı durumumaliyet analizi