Udostępniono nowe wersje kontrolne modelu LFM2.5 w formacie Q4_0, wykonane przy użyciu destylacji świadomej kwantyzacji. To podejście pozwala usmażyć model na ułamek jego oryginalnego rozmiaru, zarazem utrzymując użyteczne możliwości.

Kwantyzacja do czterech bitów (Q4_0) to technika kompresji, która zmniejsza precyzję wag neuronowych z 32-bitów do zaledwie 4 bitów na parametr. W połączeniu z destylacją świadomą kwantyzacji - metodą treningową przystosowaną do tego procesu - osiąga się znacznie lepsze wyniki niż poprzedzająca kwantyzacja już wytrenowanego modelu. Rezultatem są modele, które zajmują około jedną ósmą miejsca na dysku w stosunku do wersji pełnoprecyzyjnych.

Ta publikacja ma praktyczne znaczenie dla pracy z modelami w środowiskach o ograniczonych zasobach: na lokalnych komputerach, edgowych urządzeniach czy serwerach o niskim budżecie obliczeniowym. LFM2.5 w formacie Q4_0 pozwala na szybkie wnioskowanie bez konieczności dysponowania kosztownym sprzętem GPU. Choć kwantyzacja tradycyjnie wiąże się z pewną utratą jakości, destylacja wrażliwa na ten proces pozwala znacznie ją minimalizować.