Nowa metoda zwana quantization-aware healing pozwala skompresować modele sztucznej inteligencji do formatu 4-bitowego, co zaskakująco prowadzi do poprawy ich wydajności w stosunku do oryginalnych modeli pełnoprecyzyjnych. To znaczące odkrycie dla branży AI, bo tradycyjnie zakładano, że zmniejszanie precyzji obliczeń nieuchronnie obniża jakość wyników.
Kwantyzacja to proces zmniejszający ilość bitów potrzebnych do reprezentacji liczb - zamiast 32 bitów (full precision) używa się 4 bity. Oszczędza to ogromną ilość pamięci i przyspieszę przetwarzanie, ale zwykle pogarsza dokładność. Technika healing polega na specjalnym procesie trenowania, który uczy model działać efektywnie w tym ograniczonym formacie, a niekiedy nawet lepiej niż w wersji oryginalnej, najprawdopodobniej dzięki efektowi regularyzacji.
Praktyczne znaczenie tej metody jest duże. Kompresja do 4-bitów oznacza zmniejszenie rozmiaru modelu nawet o 8 razy, co pozwala na ich uruchomienie na słabszym sprzęcie, smartfonach czy edge deviceach. Otwarcie tej techniki przez społeczność AI-ową na Hugging Face ma demokratyzujący wpływ - zaawansowane modele stają się dostępne dla mniejszych firm, naukowców i twórców, którzy wcześniej nie mogli sobie pozwolić na infrastrukturę potrzebną do ich obsługi.