Perplexity opublikowała pplx-embed-v2-late, parę multimodalnych modeli embedding opartych na architekturze ColBERT dostępnych w dwóch rozmiarach: 0.6B (594M parametrów ogółem) do szybkich i tanich zapytań oraz 9B do maksymalnej jakości. Oba modele mogą indeksować i wyszukiwać tekst, obrazy oraz zrenderowane strony PDF, każdy działając w tej samej wspólnej przestrzeni embedding. Modele dostępne są na Hugging Face pod licencją MIT umożliwiającą użycie komercyjne - można je samodzielnie hostować na swoim sprzęcie.
Mniejsza wersja 0.6B wymaga zaledwie około 1,2 GB pamięci (w precyzji bf16) i przeznaczona jest do laptopów, urządzeń edge lub małych GPU. Mimo kompaktu ma około 240M aktywnych parametrów dla tekstu i 340M dla obrazów, co daje jej wydajność zbliżoną do konkurencyjnych modeli ośmioparametrowych. Kluczowa innowacja to 128-wymiarowe wektory na token - 16-32 razy bardziej kompaktne niż modele konkurencyjne działające na 2048-4096 wymiarach. Model 9B ze swoimi 7.4B aktywnych parametrami osiąga 92.4% wyniku na benchmarku MADQA. Elegancja systemu polega na tym, że można indeksować dokumenty modelem 9B, a następnie wyszukiwać go tanszą wersją 0.6B - takie podejście odzyskuje około połowę utraty jakości względem pełnego modelu 9B.
Perplexity planuje uruchomić hostowany endpoint API, ale obecnie nie jest dostępny - użytkownicy mogą sami deploować modele z Hugging Face. Wśród ograniczeń: model przechowuje jeden wektor na token, przez co rozmiar indeksu rośnie wraz z długością dokumentów, nie zajmuje pierwszego miejsca na benchmarku ViDoRe v3 dla wyszukiwania obrazów (wyżej plasuje się model EVIE od Tencent), a pojedyncze zapytanie nie może łączyć tekstu i obrazów. Wszystkie wyniki są samoopisane, a pełny raport techniczny nie został jeszcze opublikowany.