Tokka-Bench to nowy framework do systematycznej oceny jakości tokenizatorów, które są kluczowym komponentem dużych modeli językowych. Problem polega na tym, że dotąd brakowało ustandaryzowanego podejścia do porównywania tych narzędzi w różnych językach - każdy zespół badawczy robił to inaczej, co uniemożliwiało obiektywne wnioski.

Nowa platforma ocenia tokenizatory za pomocą pięciu komplementarnych metryk: liczby bajtów przypadających na jeden token (wskaźnik efektywności), unikalnego pokrycia tokenów, fragmentaryzacji wyrazów, częstości dzielenia słów oraz składu słownika. Co ważne, badacze dostosowali język-aware segmentation do specyfiki każdego systemu pisma - od alfabetów łacińskiego i cyrylicy, przez arabski, chiński aż po różne systemy pisma Indii i Azji Południowo-Wschodniej. Analiza obejmuje pół setki języków naturalnych w 30+ różnych skryptach, co daje bezprecedensowy zakres.

Wyniki porównania siedmiu popularnych tokenizatorów BPE (stosowanych w GPT-2, GPT-4, Llamie 3.1, Gemmie 3, Qwenie 3 i Kimi K2) ujawniają kilka istotnych spostrzeżeń. Po pierwsze, sposób, w jaki model alokuje słownik między językami, okazuje się ważniejszy niż sama wielkość słownika - wszystkie te modele mają podobne rozmiary, ale używają ich zupełnie inaczej. Po drugie, wydajność na językach programistycznych (Python, JavaScript, Java itd.) ujednoliciła się między nowszymi modelami, mimo że mają one bardzo różne profile dla języków naturalnych. Framework, dane i interaktywna tablica do eksploracji wyników są publicznie dostępne, co otwiera drzwi do dalszych analiz i optymalizacji tokenizatorów.