Naukowcy z arXiv zaprezentowali innowacyjne podejście do przyspieszenia treningu modeli językowych przy użyciu czterobitmowych liczb zmiennoprzecinkowych (FP4). Główną barierą w praktycznym zastosowaniu FP4 na Tensor Cores jest nie samo mnożenie macierzy - w tym obszarze są szybkie - lecz operacje towarzyszące: skalowanie, pakowanie operandów, konstruowanie layoutu pamięci i przechowywanie stanów gradientów. Zespół zaproponował format-aware fusion, która koordynuje każdą operację kwantyzacji z jej domeną skali i layoutem konsumenta, wspierając trzy warianty: natywne FP4, globalne zmienne formaty oraz format lokalny na poziomie cooperative thread array.

W badaniach na pretrainingu Llama-3-8B na 160 miliardach tokenów wyniki mówią same za siebie. Ich najszybsza niestandardowa ścieżka osiągnęła 37,9 tys. tokenów/sekundę/GPU - to wzrost względem bfloat16 (18,8K) i Transformer Engine (27,6K). Wersja FP4 z row-gradient stochastic rounding i preconditioningiem Hadamarda uzyskała 37,2K tokenów/s przy 86,3% wykorzystaniu FP4 operacyjnym, utrzymując dokładność: kończy tylko 2,11% wyżej niż surowy trening w bfloat16. Ważne, że wyniki downstream (tj. rzeczywista wydajność po treningu) nie korelują w pełni z rankingami strat treningowych, sugerując że wybór ścieżki obliczeń ma poważne konsekwencje dla finalnej jakości modelu.

To badanie adresuje praktyczną lukę między teorią a praktycznym deploymentem niskich precyzji w treningu wielkoskalowych modeli. Pokazuje że FP4 może rzeczywiście być sensowny ekonomicznie, jeśli implementacja jest dokładnie dopasowana do architektury sprzętu. Dla laboratoriów trenujących modele na GPU tal jak H100 czy L40S potencjał oszczędności na VRAM i mocy obliczeniowej może być znaczący.