Liquid AI opublikowała checkpointy modeli draft DSpark dla trzech głównych wariantów LFM2.5 - konkretnie dla LFM2.5-1.2B-Instruct, LFM2.5-2.6B i LFM2.5-8B-A1B. Każdy draft model dodaje ścieżkę speculatywnego dekodowania do istniejącego modelu docelowego, gdzie około 300-milionowy parametr generuje blok dziewięciu kandydatów tokenów, a docelowy model weryfikuje całość w jednym forward passie.

Technika ta wymaga niewielkiego zwiększenia pamięci, ale przynosi znaczne przyspieszenie - do 3.18x na H100 i 2.87x na MacBook Pro M4 Max. Kluczowa cecha to fakt, że wyjścia pozostają identyczne z działaniem samego modelu docelowego przy greedy decodingu, więc dokładność benchmarków się nie zmienia. Modele działają z wsparciem zarówno llama.cpp jak i SGLang, które dysponują obsługą DSpark od pierwszego dnia.

Rozmieszczenie wymaga lokalnego hostowania, gdyż wagi dostępne są w formatach Safetensors i GGUF, ale żaden dostawca hosted inference na Hugging Face nie oferuje tych drafterów. Kwestią licencji jest LFM Open License v1.0, które pozwala na bezpłatne użytkownie komercyjne do przychodu 10 milionów dolarów rocznie dla startupów i małych firm - większe przedsiębiorstwa muszą kontaktować się z Liquid AI. Rozwiązanie kierowane jest na lokalne asystenty kodowania, on-device agenty, systemy robotyczne i wdrożenia w opieki zdrowotnej, finansach i obronie, gdzie dane pozostają na urządzeniu.