Nowoczesne tokenizery multilingualne fragmentują język ukraiński znacznie bardziej niż angielski, powodując 68-121% nadmiar tokenów w standardowych systemach i aż 220% w starszych modelach. Badacze przeanalizowali dziewięć produkcyjnych tokenizeritów na przykładzie pięciu języków z cyrylicą i łaciną, badając 8,37 miliona form wyrazów. Dysproporcja ta ma bezpośredni wpływ na koszt API modeli, pojemność kontekstu i ogólną efektywność systemów dla użytkowników poza Europą Zachodnia.
Przykład: na korpusach BrUK i Brown język ukraiński wymaga istotnie więcej tokenów niż angielski, a starszy tokenizer cl100k podkreśla ten problem. Przyczyna tkwi w tym, że większość tokenizeritów trenuje się na danym angielskojęzycznym, co marginalizuje cyrylicę w budowanym słowniku. Rzeczywiście, języki o mniejszym udziale w danych treningowych internetowych - takie jak ukraiński - otrzymują mniej miejsca w słowniku, co zmusza tokenizer do dzielenia słów na mniejsze części.
Badacze przetestowali dwa podejścia naprawcze. Metoda LLMLingua-2 skompresowała ukraińskie wejścia o 47-49% w teście e-commerce bez utraty informacji. Drugi sposób - zbalansowany tokenizer BPE z limitem 200K słownika, konwergujący do 158,184 wpisów - zmniejszył stosunek overhead z 2.22x do 1.30x, znacznie zbliżając wydajność cyrylic do łaciny.