Naukowcy przygotowali zestaw 3600 zadań matematycznych z dokładnymi odpowiedziami i 8600 zapytań, zmieniając reprezentację tych samych liczb - czasem zapisując je jako ułamki zwykłe, czasem jako procenty, czasem słownie, a czasem w notacji naukowej. Każdy format powinien dać identyczną odpowiedź. Testy obejmowały pięć popularnych modeli otwartych.
Wyniki pokazały rozdźwięk między ocenami tradycyjnymi a rzeczywistym działaniem modeli. Gdy oceniano odpowiedzi bez kontekstu poprzednich wariantów (canonical accuracy), dokładność wynosiła imponujące 96,9-99,6 proc. Jednak gdy wymagano, by model udzielił spójnej odpowiedzi dla wszystkich wariantów tego samego problemu (orbit correctness), wynik spadał do 84,8-98,1 proc. To sugeruje, że modele mogą udzielać prawidłowych odpowiedzi, ale nie konsekwentnie dla różnych reprezentacji.
Najpoważniejszym problemem okazała się notacja naukowa w formacie multiplikatywnym - wiele modeli jej po prostu nie rozpoznawała poprawnie. Osobliwy przypadek to Mistral Small 4, który radził sobie źle z zadaniami opartymi na zamianie jednostek miar, generując 265 błędów, gdzie odpowiedź różniła się od prawidłowej dokładnie o potęgę liczby dziesięć. W dodatkowym eksperymencie próbowano polepszyć wyniki, zmuszając model do konsensusa między wariantami reprezentacji, ale to podejście nie przyniosło poprawy na zbiorach o niskim błędzie, a zamiast tego zwiększyło ilość fałszywych alarmów.