Functionalizer to nowa technika pre-tokenizacji, która rozkłada ortograficzne i strukturalne warianty słów na strumień operacji funkcjonalnych zamiast traktować je jak osobne wpisy słownika. Zamiast fragmentować embedding space przez zapisywanie hello, Hello i HELLO jako osobnych tokenów - lub tracić informacje przez normalizację - system koduje transformacje za pomocą operatorów (opcodes) umieszczonych w Unicode Private Use Area. Obejmuje on operatory dla wielkości liter (CAPITALIZE), znaków diakrytycznych (13 dedykowanych opcodes) i powtórzeń znaków (REPEAT, MULTIREPEAT), które są w pełni reversible.
Badania na sześciu korpusach języka naturalnego i kodu pokazały, że Functionalizer osiąga pełne pokrycie corpus z znacznie mniejszymi słownikami - zmniejszając wymagane sloty słownika aż o 16%. Jednak pojawia się ważny trade-off: metoda efektywnie kompresuje sekwencje kodu obciążone wcięciami, ale influje sekwencje tekstu naturalnego.
Wstępne testy na modelach GPT-2 skali 25M parametrów wykazały istotne polepszenia w ważności składni kodu i zmniejszeniu perpleksji dla znaków, przy zachowaniu podobnej spójności tekstu w prozie. Wyniki sugerują, że funkcjonalna dekompozycja może być efektywnym podejściem do tokenizacji, szczególnie dla zadań skoncentrowanych na kodzie.