Badacze zaproponowali nową metodę kalibracji tolerancji dla testów poprawności jąder tensorowych, która automatycznie ustala właściwe progi błędów zamiast polegać na ręcznie dobranych wartościach. Analizując dane z 8076 przebiegów testowych obejmujących 26 jąder kerneli ze zbioru gpuemu w dwóch precyzjach (fp16 i fp32), zespół określił, jakie tolerancje absolutne justyfikuje sama prawidłowa implementacja każdej operacji.
Wyniki są imponujące - obecne tolerancje ręczne były drastycznie za duże. Najmniejsze zmniejszenie dotyczyło najbardziej tolerancyjnych operacji, ale dla kernela attention_triton w fp16 nowa metoda zmniejszyła tolerancję aż 2184-krotnie. To oznacza znacznie bardziej restrykcyjne testy, zdolne wychwycić subtelne błędy, które wcześniej przeszłyby niezauważone.
W praktyce zmiana ta podniosła wykrywalność błędów w siedmiu wariantach LLM z 73,2% do 82,4%, co stanowi absolutny przyrost 9,3 punktu procentowego - 229 dodatkowych wykrytych błędów. Koszt tego zwiększenia czułości jest minimalny: liczba fałszywych alarmów na testach kontrolnych wzrosła zaledwie z 0 do 20 przypadków na 1882 poprawne implementacje, czyli mniej niż 1,1 punktu procentowego. To podejście może zmienić praktyki testowania w całym ekosystemie GPU computing, gdzie tolerancje są powszechnie kopiowane bez pytań i nigdy weryfikowane.