Brytyjski Instytut Bezpieczeństwa Sztucznej Inteligencji oraz EvalEval podejmują wysiłki mające na celu rozwiązanie rosnącego problemu z powtarzalnością wyników benchmarków w badaniach AI. Problem jest poważny - naukowcy z trudnością mogą zreprodukować wyniki opublikowane przez inne zespoły, co podważa wiarygodność całej dziedziny i utrudnia prawdziwą ocenę postępów technologicznych.

Przyczyn jest wiele: różne wersje bibliotek, niejasne parametry testowania, brak szczegółowych instrukcji konfiguracji czy brak dostępu do oryginalnych danych treningowych. Powoduje to chaos, gdzie papier może pokazywać imponujące liczby, ale inne laboratorium nie potrafi uzyskać podobnych rezultatów. Szczególnie ważne jest to dla kompleksowych benchmarków ewaluacyjnych, gdzie nawet małe różnice mogą drastycznie wpłynąć na końcowe wyniki.

Initjatywa AISI i EvalEval skupia się na ustandaryzowaniu całego procesu - od przygotowania danych, przez dokładną specyfikację parametrów modelu, aż po metodologię pomiaru. Ich podejście powinno ułatwić naukowcom i firmom technologicznym weryfikację twierdzeń dotyczących możliwości modeli AI oraz porównywanie postępów w znacznie bardziej transparentny i wiarygodny sposób.