Naukowcy z arXiv pokazali, że można znacząco przyspieszyć operacje matematyczne w dużych modelach językowych, zastępując standardowe implementacje funkcji specjalnych ich wielomianowymi przybliżeniami. Zamiast natywnych funkcji sigmoid, tanh i SiLU zaproponowali programy wielomianowe trzeciego i czwartego stopnia w formacie bfloat16, zoptymalizowane do pracy na procesorach NVIDIA GB200. Testy wykazały przyspieszenie o 1.19-2.19x dla operacji L2-resident i 1.00-1.70x dla operacji w high-bandwidth-memory.
Motywacją do badań było zaobserwowanie we FlashAttention-4, że kolejne generacje GPU skalują różne pipeline (macierzowe, funkcji specjalnych, pamięciowe) w różnych tempach. To powoduje, że wąskie gardła obliczeniowe przesuwają się w zależności od architektury sprzętu. Wielomianowe przybliżenia mogą bardziej efektywnie wykorzystać dostępne jednostki obliczeniowe, szczególnie pakując operacje multiply-add w bardziej wydajny kod.
W praktycznych zadaniach treningowych na czterech różnych konfiguracjach całkowita przepustowość kroku treningu wzrosła o 2.7% dla sieci SiLU, 2.9% dla attention z tanh-softcapping i 8.0% dla modeli z routed-expert SwiGLU. Dla samego forward passa attention z sigmoid przyspieszenie wyniosło 7.4%, choć wpływ na cały krok GPU był skromniejszy (0.3%). Wyniki zostały zweryfikowane poprzez porównanie zachowania modelu w różnych checkpoint-ach oraz pretraining experiments, co sugeruje, że przybliżenia wielomianowe nie wpływają negatywnie na jakość treningu.