Badacze z Hugging Face przedstawili projekt BenchMIRT, który dogłębnie analizuje, czy popularne benchmarki używane do oceny dużych modeli językowych rzeczywiście mierzą umiejętności, które deklarują. Okazuje się, że wiele standardowych testów, takich jak MMLU czy HumanEval, może nie w pełni odzwierciedlać rzeczywiste możliwości modeli ani ich przydatność w praktycznych zastosowaniach.
Benchmarki stały się kluczowym narzędziem w branży AI do porównywania wydajności różnych modeli. Jednak projekt BenchMIRT wskazuje na liczne problemy z ich wiarygodnością - od zbyt uproszczonych miar skuteczności, przez potencjalne wycieki danych treningowych do benchmarków, aż po nieuwzględnienie kontekstu i nuansów rzeczywistych zadań. Te odkrycia są szczególnie ważne, ponieważ firmy i badacze podejmują kluczowe decyzje dotyczące wyboru modeli na podstawie wyników tych testów.
Wartość tego badania polega na pokazaniu, że przy wyborze modeli do konkretnych zastosowań należy patrzeć poza samymi wynikami benchmarkowymi. Może to zmotywować wspólnotę do opracowania lepszych, bardziej reprezentatywnych testów oraz bardziej krytycznego podejścia do interpretacji opublikowanych wyników. Projekt BenchMIRT podkreśla potrzebę przejścia od czysto ilościowych ocen do bardziej holistycznej oceny zdolności AI.