Wiola 13M to nowy model językowy, którego autorzy specjalnie adaptowali architekturę dla reżimu małych modeli zamiast używać standardowych bloków transformatora. Projekt skupia się na trzech drop-in komponentach wkładanych do każdej warstwy, które razem tworzą bardziej wydajny system bez dodatkowych parametrów.

Pierszy komponent to Spiral Rotary Positional Encoding, który modyfikuje standardowe rotacyjne częstotliwości poprzez powoli rosnący per-wymiarowy współczynnik. Efektem jest fankowe rozszerzanie się trajektorii fazowych, co znacznie poprawia zdolność modelu do dyskryminacji długodystansowych zależności w tekście. Drugi kluczowy element to Gated Spiral Attention - mechanizm wprowadzający adaptywne bramki skalarne dla każdej głowy, oparte na przyczynowych statystykach strumienia zapytań. Zapewnia to niejawną i różniczkowalną selekcję głów bez praktycznie żadnych dodatkowych kosztów obliczeniowych. Trzeci element, blok Butterfly feed forward, zastępuje konwencjonalną warstwę ekspansji interakcją multiplikatywną i wewnętrznym bypassem, dorównując parametrom tradycyjnemu blokowi liniowego o czterokrotnym wzmocnieniu.

Co istotne, naukowcy formalnie zdefiniowali każdy komponent, opisując dokładne budżety parametrów i obliczeń. Udowodnili też, że attention bramkowany ma dokładną, numerycznie weryfikowalną równoważność między treningiem na pełnej sekwencji a kachedowanym dekodowaniem autoregressywnym, co oznacza brak aproksymacji w czasie wnioskowania. To rozwiązanie ma znaczenie dla on-device inference, szybkich eksperymentów i kontrolowanego badania właściwości modeli.