Naukowcy zaprezentowali FineServe - rzeczywisty, wielomodelowy zbiór danych zawierający informacje o obciążeniach serwowania LLM zebrane z globalnego komercyjnego rynku. Istniejące dotychczasowe badania opierały się na proxy traces lub niedostatecznie szczegółowych charakteryzacjach, które nie oddawały złożoności nowoczesnych platform multi-modelowych. FineServe rozwiązuje ten problem poprzez dostarczenie szczegółowej analizy dynamiki przybycia żądań i zachowania się tokenów.

Analiza oparta na FineServe wykazuje, że różne modele, ich skale i rodzaje zadań wykazują fundamentalnie różne reżimy zmienności. Te szczegółowe wglądy w dynamikę obciążeń są kluczowe dla zrozumienia rzeczywistych warunków eksploatacji LLM. Na bazie tych obserwacji autorzy opracowali generator obciążeń FineServe, który komponuje model-aware obciążenia w konfigurowalne mieszanki przystosowane do testowania platform serwowania multi-modelowego.

FineServe ma znaczące praktyczne konsekwencje dla branży. Dostarcza realistyczną podstawę do oceny strategii routingu, planowania zadań i pojemności w systemach serwowania LLM. W kontekście rosnącej liczby LLM wdrażanych jako usługi online dostępne zawsze, takie narzędzia stają się niezbędne dla osiągnięcia niskich opóźnień i wysokiej przepustowości przy zmiennym zapotrzebowaniu. Zbiór danych jest dostępny publicznie na GitHub.