Naukowcy z UC Berkeley i UT Austin wprowadzili na rynek FreeToken - rewolucyjny system serwowania modelów AI, który pozwala uruchomić ogromne modele takie jak GLM-5.2 na zwykłej sprzętowej karcie graficznej zamiast wymagać klastrów GPU datacenterowych. Zamiast skupiać się na nowym sprzęcie, zespół skoncentrował się na oprogramowaniu - systemie, który traktuje osobisty komputer jako ujednoliconą, elastyczną platformę inferencji, dynamicznie mapując obliczenia i stan modelu na dostępne zasoby GPU, CPU, pamięć i przepustowość sieci.
Wyniki są imponujące: model 35 miliardowy działa w interaktywnym tempie na laptopie z 8 GB RAM na GPU, 284 miliardowy na gamingowym desktopie, a całe 753 miliarda parametrów GLM-5.2 na pojedynczej karcie workstationowej. To zasadniczo zmienia ekonomikę AI - podczas gdy najnowsze modele otwartowagowe takie jak Kimi-K3, GLM-5.2 czy DeepSeek-V4-Flash dorównują własnościowym systemom, ich serwowanie dotychczas wymagało infrastruktury dostępnej jedynie dużym organizacjom.
FreeToken jest już dostępny w praktycznym wdrożeniu. Kod na licencji Apache 2.0 został opublikowany na GitHub, pakiet dostępny na PyPI (v0.1.2), a dla użytkowników Windows i Linux istnieje aplikacja desktopowa na flashml.ai. System działa na Linux x86_64 z kartami NVIDIA na sterownikach r580+ (CUDA 13) i udostępnia zgodne z OpenAI i Anthropic endpointy na porcie 1919, co czyni integrację z istniejącymi narzędziami prostą.