Linkup Research wydał SPARSEUP, otwarty model do sparse embeddingu oparty na architekturze ModernBERT z 149 milionami parametrów. Model jest dostępny na Hugging Face'u na licencji Apache 2.0 i można go załadować za pomocą bibliotek Transformers lub Sentence Transformers z opcją trust_remote_code=True.

Sparse embedding różni się od popularnych modeli dense tych, że zamiast jednego wektora na tekst, zwraca wagi dla słownika - każdy wymiar odpowiada rzeczywistemu tokenowi. To ma kilka zalet: wektory pasują do inverted indexes, są czytelne dla człowieka i generalnie lepiej radzą sobie z rzadkimi słowami. SPARSEUP powstał jako odpowiedź na wydania LightOn - DenseOn i LateOn - które dały społeczności dane treningowe, przepisy i modele, ale właśnie brakało otwartego sparse encodera. Nowy model używa tego samego backbone i danych treningowych, pozwalając porównać wszystkie trzy podejścia retrieval side by side.

SPARSEUP trenowany był startując od checkpoint LateOn-unsupervised, do którego zespół przywrócił head MLM. Fine-tuning wykorzystał mieszankę danych LightOn z contrastive learning - każde zapytanie otrzymuje 7 hard negatives z puli 50 kandydatów oraz in-batch negatives. Cały trening zmieścił się na jednym GPU H100 bez potrzeby distillacji z cross-encodera. Na benchmark BEIR-13 model osiąga 56.4 średniej nDCG@10, co Linkup określa jako najlepszy rezultat wśród publicznych sparse encoderów poniżej 150M parametrów.