Naukowcy wprowadzili BCMT, nową architekturę transformera rozwiązującą problem kwadratowej złożoności gęstej samoatencji przy modelowaniu długich zależności. Model dzieli sekwencję na bloki, w obrębie których stosuje gęstą atencję przyczynową, a następnie agreguje streszczenia tokenów przez eksponencjalną pamięć przyczynową.

Klucz do efektywności leży w całkowicie paralelizowanym mechanizmie pamięci, który nie wymaga uczonych stanów pamięci ani gęstych interakcji między odległymi tokenami. Wstrzykiwana z powrotem pamięć umożliwia propagowanie informacji kontekstowych na duże odległości bez tradycyjnej atencji globalnej. To podejście pozostaje kompatybilne ze standardowymi implementacjami transformerów, ułatwiając praktyczne zastosowanie.

Testy na zadaniach modelowania języka z kontekstami sięgającymi 1024 tokenów pokazały, że BCMT utrzymuje wydajność zbliżoną do Dense Transformerów, ale znacznie poprawia przepustowość treningu i zmniejsza wymogi pamięciowe. Badania ablacyjne potwierdziły, że te korzyści pochodzą właśnie z proponowanego mechanizmu pamięci, sugerując, że eksponencjalna pamięć przyczynowa zbudowana ze streszczień bloków stanowi praktyczne rozwiązanie dla długokontekstowego modelowania języka.