Naukowcy z zakresu machine learning opracowali MARCH - nową architekturę przezwyciężającą fundamentalne ograniczenia zarówno transformerów, jak i efektywnych alternatyw. Problem polega na tym, że transformery dysponują doskonałą pamięcią na poziomie tokenów, ale wymaga to złożoności O(n²) w treningu i rosnącej cache wartości kluczy podczas generowania tekstu. Z kolei modele state-space oszczędzają obliczenia poprzez kompresję całej historii do stałego stanu, lecz tracą wcześniejsze asocjacje, które są nadpisywane przez nowsze aktualizacje.
MARCH rozwiązuje ten problem dzieląc historię na kawałki i okresowo zapisując stany jako zakotwiczenia pamięci, każde powiązane z kompaktowym kluczem opartym na treści. Tworzy to dynamiczny bank pamięci, który rośnie wraz z długością kontekstu, ale pozostaje kontrolowalny. Podczas przetwarzania każdego tokena model generuje zapytanie do wszystkich dostępnych zakotwicizeń stanów i agreguje ich wkład przy użyciu mechanizmu podobnego do attention. Podejście to łączy wydajność obliczeń state-space z ogólnie lepszymi zdolnościami do utrzymywania informacji z wcześniejszych części tekstu.
Wyniki pokazują, że MARCH konsekwentnie przewyższa modele linear attention po standardowym pretreningu, szczególnie na zadaniach recall-intensive gdzie zapamiętanie odległych asocjacji ma znaczenie. Jest to istotny krok w kierunku architektury zdolnej do obsługi naprawdę długich kontekstów bez kary za wydajność, co ma potencjał do wywarcia wpływu na praktyczne zastosowania takie jak przetwarzanie długich dokumentów czy kontekstowe konwersacje.