FluidPD to nowy system do serwowania dużych modeli językowych, który rozwiązuje problem nierównowagi między fazami prefill i decode. W tradycyjnych architekturach dystrybucja pracowników między dwiema fazami jest stała, co prowadzi do pogorszenia opóźnień gdy obciążenie pracy zmienia się dynamicznie - nawet jeśli w systemie istnieje wolna pojemność.

System wprowadza dwa komplementarne mechanizmy. FluidToken odpowiada za przejściowe nierównowagi, przesuwając część obliczeń prefill do pracowników decode gdy ci ostatni są niedoużywani, bez konieczności restartowania silnika. FluidRole natomiast obsługuje dłuższe nierównowagi poprzez reassignment już działających pracowników między role prefill i decode, unikając przeładowania modelu. Oba podejścia są kierowane lekkim systemem wskaźników ciśnienia zasobów, który wykrywa problemy zanim zamanifestują się jako naruszenia SLO.

Ewaluacja na rzeczywistych tracach obciążeń z platformy Azure wykazała, że FluidPD osiąga nawet 94,6 procentowego punktu większego spełnienia Service Level Objective w porównaniu do statycznego systemu SGLang. To oznacza znaczną poprawę w spełnianiu gwarancji czasu odpowiedzi dla użytkowników, szczególnie ważną dla aplikacji wymagających przewidywalnych opóźnień.