Together AI publikuje poradnik dotyczący automatycznego skalowania infrastruktury dla wnioskowania dużych modeli językowych, adresując kluczowy problem - GPU może wykazywać zdawałoby się zdrowe wykorzystanie, podczas gdy kolejka zapytań gwałtownie rośnie. Nowe repliki potrzebują minut na rozruch, co dodatkowo pogorsza opóźnienia.
Zasadnicze wyzwanie polega na wyborze właściwych metryk skalowania. Tradycyjny monitoring wykorzystania GPU okazuje się niewystarczający - może pokazywać wysokie wartości, podczas gdy system faktycznie nie radzi sobie z przetwarzaniem requestów w akceptowalnym czasie. Together AI rekomenduje uwzględnianie głębi kolejki, opóźnień end-to-end oraz czasu do pierwszego tokena jako bardziej wiarygodnych wskaźników obciążenia.
Drugą część poradnika stanowi konfiguracja okien skalowania - czasowych interwałów, w których system decyduje o zwiększeniu lub zmniejszeniu zasobów. Zbyt agresywna konfiguracja prowadzi do niestabilności infrastruktury i zbędnych kosztów, natomiast zbyt konserwatywna utrzymuje rezerwowe zasoby, które mogą być marnowane. Trzecim elementem jest budżetowanie kosztów związanych z cold starts - czasem potrzebnym do uruchomienia nowych instancji modelu, które najpierw muszą załadować wagi do GPU. Dla produkcyjnych deploymentów dedicated inference to istotny element planowania wydatków operacyjnych.