Araştırmacılar bugün BenchMIRT adlı bir yöntem tanıttı; bu araç, büyük dil modellerinin (LLM) benchmark sonuçlarını bireysel sorular düzeyinde inceleyerek hangi yeteneklerin skoru etkilediğini ortaya koyuyor.

BenchMIRT, psikometri kökenli çok boyutlu IRT (MIRT) modelini kullanıyor ve 100 LLM'i, 16 farklı benchmark ve 34 000'den fazla soruyu içeren bir veri setiyle eğitti. Analiz, güvenlik ve genel akıl yürütme olmak üzere iki ana boyutun hâkim olduğunu gösterdi; örneğin BBQ soruları güvenlikten çok akıl yürütme ile ilişkilendirildi, WMDP ise akıl yürütme yeteneği arttıkça düşük puan alıyor.

Yöntem, soruların zorluk ve ayırt edicilik ölçüleriyle model performansını %79 doğrulukla tahmin edebiliyor, ancak yalnızca Mart 2025'e kadar yayımlanan modellerle sınırlı ve kullanılan benchmark setine bağlı olarak ortaya çıkan boyutlar değişebiliyor. Bu durum, araştırmacıların daha odaklı ve şeffaf değerlendirmeler tasarlamasına imkan tanırken, güvenlik sorularının çıkarılmasının kötüye kullanım riskini de beraberinde getiriyor.