Naukowcy z arXiv CS.LG udowodnili nowe granice złożoności modelów sekwencyjnych dla prognozowania z długoterminową pamięcią. Dla algebraicznie malejącej pamięci predykcyjnej wykazali, że najlepszy błąd prognozy przy r modach spada jak e^(-Theta(sqrt r)), co oznacza, że uzyskanie błędu tau wymaga r = Theta(log²(1/tau)) stanów. To ustala optymalny wykładnik zasobów dla tego kanonicznego celu predykcyjnego.
Badania rozszerzają się na bardziej złożone scenariusze z pamięcią ułamkową, która zmienia samą geometrię problemu. Dla prognozowania ze skończonym kontekstem długości L błąd ma dokładny wiodący porządek 1/L, a ustalona siła ułamkowa d zachowuje kwadratowo-logarytmiczne prawo złożoności stanu. Naukowcy zidentyfikowali również odpowiednie skale d² i d⁴ blisko granicy krótkich pamięci oraz podali jednolite konstruktywne prawo w reżimie pośrednim.
Dla nieliniowych rekurencji kontekstowych ze skurczającą się dynamiką stanów badacze wyprowadzili obwiednię pierwszego chaosu i jawny warunek konieczny łączący błąd prognozy ze złożonością modelu. Te teoretyczne wyniki mają praktyczne znaczenie dla zrozumienia, ile parametrów i stanu wewnętrznego rzeczywiście potrzebują modele transformer i rekurencyjne do efektywnego przetwarzania długich sekwencji z zależnościami czasowymi.