Naukowcy opracowali nową metodę attention dla transformerów, która znacznie zmniejsza obliczeniowe koszty komunikacji między wątkami obliczeniowymi. Wynalazek o nazwie LACE - Lattice Attention w sieci kratowej - pozwala modelom na bardziej efektywną eksplorację informacji poprzez zorganizowanie interakcji wśród wątków w strukturze sieciowej zamiast tradycyjnego podejścia all-to-all. To oznacza, że zamiast każdego tokenu rozmowy z każdym innym tokenem, komunikacja odbywa się w bardziej selektywny sposób - wzdłuż linii kratowych struktury. Rezultat to znacznie niższe wymagania obliczeniowe i pamięciowe, szczególnie ważne dla dłuższych sekwencji danych.
Dotychczasowe modele transformerowe stanęły przed fundamentalnym wyzwaniem: klasyczne attention jest kwadratowe w złożoności względem długości tekstu. Kiedy sekwencja rośnie z 1000 do 10000 tokenów, koszt obliczeniowy gwałtownie się zwiększa. LACE rozwiązuje ten problem poprzez wprowadzenie bardziej wydajnego schematu transmisji informacji między wątkami. Zamiast pełnej macierzy attention, metoda wykorzystuje strukturę kratową, w której każdy token komunikuje się tylko z wybranymi sąsiadami - wzdłuż wierszy i kolumn sieci. To pozwala utrzymać zdolność modelu do zrozumienia globalnych zależności w tekście, ale przy znacznie niższych kosztach pamięciowych.
Praktyczne znaczenie tej innowacji jest duże dla wszystkich branż operujących na dużych modelach językowych. Szybsze przetwarzanie, niższe zapotrzebowanie na moc obliczeniową i możliwość obsługi dłuższych kontekstów bez przesadnych wymagań technicznych - to dokładnie to, czego szukają zespoły zajmujące się wdrażaniem sztucznej inteligencji. LACE otwiera drzwi do bardziej zoptymalizowanych, tańszych systemów AI, co szczególnie istotne dla małych firm i badaczy niemających dostępu do ogromnych farm serwerów.