Naukowcy opracowali Toeplitz MLP Mixers - nową architekturę neural network, która łączy macierze Toeplitza z popularną metodą MLP Mixer do przetwarzania sekwencji danych. Innowacja polega na tym, że osiąga wysoką wydajność przy znacznie niższej złożoności obliczeniowej niż tradycyjne transformery. To rozwiązanie szczególnie cieszy się zainteresowaniem w kontekście ograniczonych zasobów sprzętowych, gdzie każdy FLOP ma znaczenie.
Struktury Toeplitza to macierze o specjalnych właściwościach matematycznych - każda diagonala zawiera identyczne wartości, co pozwala na efektywniejsze obliczenia pamięciowe. Połączenie tego pomysłu z architekturą MLP Mixer, która zamiast mechanizmu attention stosuje warstwy pełnoconnected do mieszania tokenów, daje model zarówno lekki, jak i zdolny do skutecznego kodowania informacji. Wyniki testów wskazują, że Toeplitz MLP Mixers radzą sobie dobrze na szeregu zadań sekwencyjnych, gdzie dotychczas dominowały transformery.
Znaczenie tego podejścia rośnie wraz z tendencją do wdrażania modeli AI na urządzeniach mobilnych i w chmurze obliczeniowej, gdzie koszty mocy obliczeniowej są kluczowym wyzwaniem. Choć transformery pozostają standardem, rozwiązania takie jak Toeplitz MLP Mixers otwierają możliwość efektywnego przetwarzania na sprzęcie o ograniczonej wydajności, bez drastycznego spadku jakości wyników. To może zmienić podejście do architektury modeli, zwłaszcza w przypadkach, gdzie mniej mocy to więcej praktyczne zastosowań.