Liquid AI wydała dwa otwarte bidirectionalne kodery - LFM2.5-Encoder-230M i LFM2.5-Encoder-350M, które radzą sobie szybko z kontekstem 8192 tokenów nawet na zwykłych procesorach CPU. Modele zostały zbudowane na bazie architekektury LFM2 i funkcjonują jako kodery zdolne do klasyfikacji tekstu, interpretacji intencji użytkownika, filtrowania zagrożeń bezpieczeństwa oraz detekcji danych wrażliwych. To ogromnie ważne, bo takie prace wykonywane są w systemach produkcyjnych zwykle bez dostępu do GPU, a czasem muszą przetwarzać bardzo długie teksty.
Modele nie zostały wytrenowane od zera - zamiast tego stanowią adaptację istniejących dekoderów LFM2.5-230M i LFM2.5-350M. Liquid AI dokonała trzech kluczowych zmian: najpierw zamieniono przyczynową maskę atencji na bidirectionalną, żeby każdy token widział tokeny z obu stron; następnie zmieniono konwolucje LFM2 z przyczynowych na symetryczne, wreszcie model został wytrenowany z celem masked language modeling przy 30-procentowym stopniu maskowania - gęstszym niż w oryginalnym BERT-ie. Architektura LFM2 jest wkontynuacją linii mającej początek w BERT-ie, którą Later rozwijał ModernBERT - Liquid AI wykazuje jednak, że jej rozwiązanie skaluje się taniejsi, bo koszt wzrasta wolniej wraz z długością wejścia.
Trening przebiegał w dwóch etapach: pierwszy na dużym zbiorze danych internetowych przy kontekście 1024 tokenów, aby model nauczył się ogólnych umiejętności językowych, a drugi na pełnym miksie danych z wydłużoną sekwencją do 8192 tokenów, aby wzmocnić rozumienie faktów, tekstu prawniczego i wielojęzyczności. To podejście pokazuje praktyczne zastosowanie dla branży, gdzie kodery pracują w tle, intensywnie, i muszą być zarówno szybkie jak i dokładne.