Knowledgator Engineering wypuścił GLiFormer, uniwersalny enkoder do ekstrakcji informacji, który obsługuje pięć kluczowych zadań: rozpoznawanie nazwanych encji, klasyfikację tekstu, ekstrakcję relacji, strukturyzację zagnieżdżonego JSON i tworzenie osadzeń tekstowych. W przeciwieństwie do dużych modeli językowych, GLiFormer nie generuje pola JSON, interpunkcji i wartości token po tokenie - zamiast tego wylicza kompatybilność między zakodem źródłem a żądanym schematem. Dwa dostępne checkpointy mają odpowiednio 264,2M (Base v1) i 575,6M parametrów (Large v1), a największa wersja osiąga wynik 91,10 F1 w zagnieżdżonych ekstraktach JSON.
Tradycyjne podejście wymagało łańcucha oddzielnych modeli - jeden do tagowania encji, drugi do klasyfikacji dokumentów, trzeci do odbudowy rekordów. GLiFormer upraszcza to, rozpoznając że wszystkie te zadania sprowadzają się do jednej operacji: jednokrotnego kodowania źródła, reprezentacji żądanych pojęć i oceny ich kompatybilności. Architektura buduje się na GLiNER i wprowadza koncepcję "anchor" - obiektu, względem którego każda etykieta ze schematu uzyskuje wynik. Dla klasyfikacji anchor to grupa wektorów, dla relacji to para encji, dla structured output to slot w rekordzie.
Model jest już dostępny na licencji Apache 2.0, można go zainstalować przez pip i uruchomić na CPU lub GPU bez specjalnych wymagań. Podejście beztokenowe przynosi praktyczną zaletę - zarówno szybkość wnioskowania jak i deterministyczność wyników, co jest kluczowe dla systemów produkcyjnych wymagających niezawodności ekstrakcji danych.