Nowe badanie z arXiv pokazuje fundamentalny problem w testowaniu hostowanych modeli językowych - wyniki mogą się znacząco różnić w zależności od tego, jak przeprowadzony jest test. Zespół badawczy oddzielił trzy kluczowe pytania: czy poprzedni wynik powtarza się na nowych danych przy tej samej konfiguracji (replikacja), czy zmiana konfiguracji pomiaru zmienia wynik przy tym samym identyfikatorze modelu (wrażliwość pomiaru), i czy wynik utrzymuje się dla różnych wersji modelu (trwałość).

Do badań użyto środowiska Regent Chess, który pozwala na precyzyjne rejestrowanie zmian stanu i porównywanie odpowiedzi modelu z rzeczywistością. Wcześniej raportowana luka w wydajności Gemini 3.1 Flash-Lite (+0.0530 w przedziale ufności 95 procent) rzeczywiście pojawiła się na świeżych danych. Jednak gdy badacze uruchomili ponownie test tego samego modelu tego samego dnia z zmienioną konfiguracją (wszystkie sześć komponentów uległo zmianie), wynik spadł do 0.0429 - różnica wystarczająca aby potencjalnie zmienić wnioski badania.

Ustalone wynikom nie były trwałe - porównanie między Gemini 3.1 a Gemini 3.7 zmusiło znaki na odwrót w zbudowanej na nowo konfiguracji. To odkrycie ma duże znaczenie dla społeczności zajmującej się ewaluacją AI. Oznacza to, że benchmarki oparte na hostowanych modelach mogą być mniej wiarygodne niż się wydaje, ponieważ sama zmiana parametrów testowych może istotnie wpłynąć na wyniki. Praktycznie rzecz biorąc, porównywanie wydajności modeli może być trudniejsze i bardziej skomplikowane niż dotychczas sądzono.