Naukowcy zaproponowali LoKiFormer, architekturę która konwerguje 1,33 razy szybciej podczas pretreningu niż istniejące modele LLM. Problem, który rozwiązuje, dotyczy dwóch fundamentalnych nieefektywności w dzisiejszych dużych modelach języka: po pierwsze, standardowa self-attention nie posiada jawnego mechanizmu preferującego informacje lokalne w sekwencji, co prowadzi do zbędnego modelowania bliskich sobie tokenów; po drugie, podejście mixture-of-experts (MoE) nierozerwalnie łączy przechowywanie wiedzy z obliczeniami, uniemożliwiając elastyczną rekuperację informacji globalnych.

Rozwiązanie składa się z dwóch dedykowanych modułów. Local Fusion Attention (LFA) integruje operacje konwolucyjne z mechanizmem uwagi, eksplicytnie wychwytując lokalne wzorce i pozwalając uwadze pracować na bardziej informatywnych reprezentacjach. Knowledge Memory Module (KMM) wprowadza parametryczną pamięć klucz-wartość, która przechowuje globalną wiedzę w adresowalnych pozycjach, efektywnie rozdzielając przechowywanie od obliczeń.

Ta architektura ma znaczenie dla całej branży, ponieważ przyspeszenie pretreningu o trzecią część to istotna optymalizacja przy bieżących kosztach szkolenia najduższych modeli. Jeśli wyniki będą powtarzalne na większych skalach, LoKiFormer mogłby wpłynąć na sposób, w jaki projektuje się i trenuje nowe generacje LLM, szczególnie w kontekście rosnących wymagań energetycznych tego procesu.