Zespół Hugging Face wraz ze współpracownikami przeprowadził systematyczną analizę odtwarzalności 2200 artykułów naukowych z międzynarodowej konferencji ICML z lat 2019-2021. Wysiłek ujawnił alarmujący obraz stanu powtarzalności w badaniach nad uczeniem maszynowym i sztuczną inteligencją.

Wśród głównych odkryć znalazły się: brakujące dane treningowe niezbędne do rekonstrukcji eksperymentów, niejasne opisy procedur metodologicznych uniemożliwiające dokładne odtworzenie pracy, oraz przypadki, w których zaproponowane nowe podejścia nie wykazywały rzeczywistej przewagi nad uproszczonymi modelami bazowymi. Wiele prac nie udostępniało kodu źródłowego lub zawierało błędy implementacyjne. Problem był szczególnie wyraźny w pracach wprowadzających nowe architektury neuronowe lub techniki fine-tuningu, gdzie osiągnięte wyniki były trudne do zweryfikowania.

To badanie ma istotne implikacje dla całej ekosystemu badawczego w AI. Odkrywki podkreślają potrzebę wyższych standardów publikacyjnych, obowiązkowego udostępniania kodu i danych, oraz bardziej rygorystycznego podejścia do ewaluacji i porównań metodologicznych. Problem powtarzalności wpływa na tempo rzeczywistego postępu naukowego i może prowadzić do budowania dalszych badań na niepewnych fundamentach. Inicjatywa Hugging Face pokazuje, że reforma praktyk publikacyjnych w nauce o AI jest niezbędna dla kredytu naukowego całej dziedziny.