Liquid AI zaprezentowała LFM2.5-VL-3B-DSpark, eksperymentalny model pomocniczy wykorzystujący technikę spekulatywnego dekodowania dla modelu wizyjno-językowego LFM2.5-VL-3B. Model zawiera około 280 milionów dodatkowych parametrów i osiąga do 3.13-krotne przyspieszenie dekodowania na Apple silicon oraz do 2.66-krotne na procesorze NVIDIA H100, bez zmian w generowanych wynikach.

Spekulatywne dekodowanie zmienia fundamentalnie sposób działania modelu. Standardowe modele generują jeden token w jednym przebiegu. W tym podejściu mały drafter proponuje kilka tokenów naraz, a duży model docelowy weryfikuje całą grupę w jednym przebiegu i zatrzymuje tokeny, z którymi się zgadza. Kluczową zaletą jest to, że architektura draftera nie zależy od modalności - zarówno tekstowe tokeny jak i fragmenty obrazów są reprezentowane jako tensory w ukrytych warstwach modelu. Liquid AI mogła więc ponownie wykorzystać tę samą algorytmikę do swojego modelu wizyjno-językowego.

Wagi modelu są już dostępne na platformie Hugging Face w formatach Safetensors i GGUF, z natychmiastowym wsparciem w frameworkach SGLang, MLX-VLM i llama.cpp. Model wydano na warunkach licencji LFM Open License v1.0, która pozwala na bezpłatne użycie komercyjne tylko dla firm z rocznym przychodem poniżej 10 milionów dolarów. Zespół zaznaczył, że to wciąż wersja eksperymentalna, jednak praktyczna dostępność pozwala deweloperom natychmiast testować technologię w rzeczywistych aplikacjach.