Naukowcy podjęli się replikacji eksperymentów z badania proponującego formułę alpha-FLOPs do oceny czasów wykonywania operacji w modelach AI. Podczas tego procesu natrafiли na istotne ograniczenia - materiały do replikacji brakowało szczegółów dotyczących zależności i przejrzystości danych do regresji, co utrudniło dokładne zweryfikowanie oryginalnych wyników na nowszym, bardziej wydajnym sprzęcie.
Wyniki potwierdzają, że same Floating Point Operations nie stanowią odpowiedniego wskaźnika czasu wykonania - wymiary przestrzenne pozostają łatwiejsze do zrównoleglenia niż wymiary kerneli. Jednak dokładne pomiary ujawniły, że relacja jest znacznie bardziej skomplikowana niż pokazywały to poprzednie badania. Nowsze procesory wykazują niestabilności i nieciągłości w czasach wykonania, pojawiają się skoki i oscylacje, które formuła alpha-FLOPs generalnie niedoszacowuje.
Praca ta ma kluczowe znaczenie dla oceny efektywności AI, ponieważ pokazuje, że metryki takie jak FLOPs mogą być mylące, a metodologia ich walidacji musi być aktualizowana wraz z ewolucją sprzętu. Replikacja badań odsłania także problemy z dokumentacją i dostępnością danych, które utrudniają naukową reprodukowalność w dziedzinie oceny wydajności modeli AI.