Rozproszone wnioskowanie dla dużych modeli językowych napotkało problem, który dotychczasowe systemy takie jak DistServe, Splitwise i Mooncake ignorowały lub rozwiązywały słabo. Kiedy prefill i decode działają na osobnych pulach GPU, cache wartości-klucza musi być transferowany między nimi. Dla modelu 70B to 2,6 GB na każde żądanie, co w skali produkcyjnej daje ponad 100 GB/s ruchu sieciowego. Tymczasem przepustowość między GPU drastycznie się różni w zależności od ich fizycznej relacji - osiąga 900 GB/s via NVLink w obrębie jednej domeny, spada do 50 GB/s przez InfiniBand między węzłami i wynosi jedynie 12,5 GB/s przez TCP między data centrami.
Nowe podejście wprowadza topology-aware transfer orchestrator, który na starcie odkrywa hierarchię połączeń i wybiera optymalny transport dla każdego transferu. System łączy trzy mechanizmy działające razem: pipelinowy transfer warstwa po warstwie, który nakłada transmisję na trwające obliczenia prefill i ukrywa 60-85 procent opóźnień; inteligentne rozmieszczenie modeli Mixture-of-Experts uwzględniające lokalizację KV cache dla optymalizacji dystrybucji ekspertów; oraz zastosowanie pamięci CXL 3.0 jako współdzielonej warstwy overflow z 6-krotnie większą pojemnością przy 86-krotnie mniejszym opóźnieniu niż NVMe.
Badacze prezentują analityczne modele przepustowości, implementacje poszczególnych komponentów i prognozowaną wydajność na trzech architekturach, pokazując redukcję opóźnień transferu od 3 do 18 razy. Pełna ewaluacja wymagałaby wielowęzłowych klastrów z heterogenicznymi połączeniami i sprzętem CXL 3.0, który jeszcze nie jest powszechnie dostępny w chmurach GPU.