Perplexity Engineering opublikował szczegółowy opis infrastruktury obsługującej model embeddings pplx-embed, który wykorzystywany jest do wyszukiwania i rankingu dokumentów w serwisie. Zespół wyjaśnił, że największe wygrane nie pochodzą ze sprzętu GPU czy algorytmów, ale z optymalizacji warstwy runtime: zarządzania CUDA graphs, asynchronicznych abstrakcji do śledzenia wyników i implementacji ścieżki żądań w Rust.
Klucza decyzja projektowa to ponowne wykorzystanie istniejących kerneli z LLM stack zamiast budowania oddzielnego serwera dla embeddings. Embedding modele to małe Transformery, a batch embedding podczas indeksowania przypomina compute-bound prefill, podczas gdy online embedding w czasie zapytania (kilka tokenów) przypomina memory-bound decode. Perplexity zidentyfikował trzy odrębne przypadki użycia: batch embedding minimalizujący koszt przy indeksowaniu, online embedding wymuszający szybką konwersję zapytania, oraz scoring gdzie duże partie dokumentów są rankingowane z zrównoważenymi wymogami throughputu i latencji.
Trzema serwisami obsługującymi proces są Ivy (Rust HTTP gateway wykonujący CPU-side work), Tulip i ROSE. To podejście stanowi praktyczną lekcję o optymalizacji systemów AI w produkcji - fokus na warsztwie runtime zamiast wyścig zbrojeń w sprzęcie, oraz ponowne użycie istniejącego kodu. Dla branży to pokazuje, że rzeczywiste zyski w embeddings come z inżynierii infrastruktury, nie z modeli samych w sobie.