Perplexity Research i turbopuffer udostępniają pplx-embed-v2-context-9b-preview - model embeddingów zaprojektowany specjalnie dla pipelinów retrieval-augmented generation (RAG) z innowacyjnym podejściem do treningu. Zamiast tradycyjnego wskazywania jednego "złotego fragmentu" na dokument, model uczy się pobierać odpowiedź razem z całym kontekstem potrzebnym do jej weryfikacji. Każdy chunk tekstu jest embeddowany z widokiem pełnego dokumentu, co stanowi zasadniczą zmianę w stosunku do dotychczasowych praktyk.
Tradukcyjne systemy RAG dzielą długie dokumenty na małe fragmenty, ale każdy chunk często zależy od jednostki, nagłówka czy definicji zawartej indziej w tekście. Dotychczasowe trenowanie modelów zazwyczaj oznaczało tylko jeden gold chunk jako pozytywny dla każdego zapytania, automatycznie przekształcając każdy inny fragment w negatyw - nawet te zawierające kluczowe informacje weryfikujące odpowiedź. Perplexity identyfikuje dodatkowe problemy tego podejścia: binarne labele dają zbyt grube sygnały treningowe, anotacja przy użyciu LLM skaluje się liniowo z rozmiarem datasetu, a etykiety są przywiązane do konkretnej strategii podziału na chunki.
Model jest dostępny jako samodzielnie deployowalny preview z wagami opublikowanymi na Hugging Face pod licencją MIT. Wymaga transformers w wersji co najmniej 5.4.0 z włączoną opcją trust_remote_code=True. Ostrzeżenie: model card wskazuje, że wagi i interfejs mogą się zmienić bez gwarancji kompatybilności wstecznej. Funkcjonalność nie jest jeszcze dostępna w publicznym API Perplexity.