Zespół naukowców zaprezentował router zapytań dla modeli językowych, który uwzględnia opóźnienia generowania przy przydzielaniu zadań do instancji modeli. Dotychczasowe systemy routingu optymalizowały przede wszystkim dokładność odpowiedzi i koszt obliczeniowy, ignorując faktor latencji doświadczanej przez użytkowników. W praktyce latencja była kontrolowana przez proste strategie load-balancingu takie jak round-robin czy join-the-shortest-queue, które nie brały pod uwagę dokładności modelu ani kosztów inference.

Klucz do rozwiązania to lekki estymator opóźnień, który symuluje autoregresywne przetwarzanie batch tokenów w framework'u serwującym modele. Estymator przewiduje czas do pierwszego tokenu (TTFT), biorąc pod uwagę zarówno długość promptu, jak i obecne obciążenie prefill i decode na instancji modelu, a także politykę schedulingu i batchingu używaną przez framework. Nowy router integruje ten estymator z algorytmem optymalizującym trzy parametry jednocześnie: latencję, dokładność i koszt.

Wyniki eksperymentalne pokazują, że wspólna optymalizacja tych trzech wymiarów osiąga do 40 procent poprawy w użyteczności accuracy-cost przy zachowaniu tych samych opóźnień co standardowe podejścia do load-balancingu. To oznacza znaczny potencjał dla systemów obsługujących dynamiczne obciążenia, gdzie zarówno szybka odpowiedź, wysoka jakość i efektywność kosztowa są krytyczne. Rozwiązanie szczególnie istotne dla dużych serwisów API obsługujących LLM, gdzie każdy milisekunda opóźnienia wpływa na doświadczenie użytkownika.