Perplexity AI otworzył kod swoją wersję tokenizera Unigram, którą twierdzi, że jest 5 razy szybsza niż popularna implementacja z HuggingFace. Tokenizer to niewielki, ale niesamowicie istotny kawałek infrastruktury każdego modelu językowego - odpowiada za rozbijanie tekstu na mniejsze części zwane tokenami, które model może przetwarzać. W praktyce oznacza to, że masz do czynienia z jednym z wąskich gardeł, przez które przechodzą niemal wszystkie dane wchodzące do systemów AI. Dlatego właśnie optymalizacja tego etapu może dać nam zauważalny skok w wydajności całych aplikacji.

Udostępnienie tego kodu w postaci open source ma znaczną wagę dla całego ekosystemu. Mniejsza latencja p50 - czyli czas odpowiedzi dla mediany zapytań - bezpośrednio przekłada się na szybsze obsługiwanie użytkowników w aplikacjach korzystających z dużych modeli językowych. To szczególnie ważne dla usług działających w czasie rzeczywistym, gdzie każda millisekunda się liczy. Wcześniej deweloperzy byli skazani na rozwiązania HuggingFace lub inne implementacje, które były mniej optymalne. Teraz mają dostęp do rozwiązania, które Perplexity przetestował i udowodnił jako znacznie efektywniejsze.

Taki ruch pokazuje też, jak intensywnie konkurują ze sobą firmy zajmujące się AI - Perplexity nie tylko buduje lepsze modele, ale też otwiera swoje ulepszone narzędzia dla reszty branży. To może przyspieszać całą ścieżkę innowacji w obszarze LLM-ów, bo inne firmy będą mogły zbudować na tym fundamencie jeszcze lepsze rozwiązania. W praktyce dla użytkowników końcowych oznacza to szybsze odpowiedzi z chatbotów, mniej problemów z opóźnieniami i lepsze doświadczenie ogólnie.