Naukowcy opracowali alternatywną architekturę do tradycyjnych Transformerów, zastępując mechanizm attention serii autoenkoderów z wąskim gardłem. Zamiast kosztownych mechanizmów attention, model używa trzech warstw autoenkoderów - jedną dla lokalnych sąsiedztw, jedną dla pełnej sekwencji i jedną dla głów attention - każda kompresująca i rekonstruująca dane przez wąskie gardło.

Inowacją jest także procedura iteracyjnego ulepszania dla pozycji maskowanych, składająca się z dwóch kroków. Krok "pulling" przyciąga reprezentację osadzenia do średniej ważonej sąsiednich tokenów, a następnie krok "correcting" projektu rezultat powrotnie na nauczoną rozmaitość za pośrednictwem autoenkodera. To podejście utrzymuje właściwości content-dependent przy znacznie mniejszych kosztach obliczeniowych.

Wyniki są obiecujące - model osiąga około 1.9 razy mniej operacji FLOPs przy zachowaniu znaczącej części wydajności attention, gdy trenowany na korpusie C4. Szczególnie impresjonujące są rezultaty na rzadkich tokenach przy zastosowaniu frequency-aware schedule'u do maskowania, gdzie model dorównuje wydajności BERT i TinyBERT. To sugeruje potencjał dla bardziej efektywnych modeli języka, które mogą lepiej radzić sobie ze słownictwem edge-case'ów.