Los investigadores presentaron hoy un método llamado BenchMIRT; esta herramienta examina los resultados de benchmark de los grandes modelos de lenguaje (LLM) a nivel de preguntas individuales, revelando qué habilidades influyen en la puntuación.
BenchMIRT emplea un modelo multidimensional IRT (MIRT) de origen psicométrico y entrenó a 100 LLM con un conjunto de datos que incluye 16 benchmarks diferentes y más de 34 000 preguntas. El análisis mostró que predominan dos dimensiones principales: seguridad y razonamiento general; por ejemplo, las preguntas de BBQ se relacionan más con el razonamiento que con la seguridad, mientras que WMDP obtiene puntuaciones bajas a medida que aumenta la capacidad de razonamiento.
El método puede predecir el rendimiento del modelo con un 79 % de precisión utilizando las medidas de dificultad y discriminación de las preguntas, aunque está limitado a modelos publicados hasta marzo de 2025 y las dimensiones emergentes pueden variar según el conjunto de benchmarks utilizado. Esta situación permite a los investigadores diseñar evaluaciones más focalizadas y transparentes, pero la eliminación de preguntas de seguridad también conlleva un riesgo de uso indebido.
