Zespół z platformy Chutes przeprowadził szczegółową analizę pełnego roku pracy systemu serwowania Large Language Models, rejestrując rzeczywiste zachowanie użytkowników w produkcji. W przeciwieństwie do poprzednich studiów, które obserwowały krótkie okresy lub fragmentaryczne dane, ta praca prezentuje kompletny obraz obciążenia obejmujący popularne modele, niszowe wariacje oraz pełne spektrum interakcji użytkowników.

Wielka waga tego badania polega na ujawnieniu czasowych wzorców i ewolucji obciążenia, które zwykle pozostają ukryte za uśrednionym widokiem statystyk. Analiza obejmuje perspektywy agregacyjne, czasowe, na poziomie poszczególnych modeli i poszczególnych użytkowników - dostarczając najpełniejszego dotychczas obrazu tego, jak faktycznie działają produkcyjne systemy LLM. Znaleziska mogą bezpośrednio wpłynąć na projektowanie lepszych strategii cache'owania, load-balancingu i alokacji zasobów.

Publikacja pełnego rocznego śladu danych wraz z artykułem stanowi przełom dla społeczności badawczej. Zamiast konstruowania syntetycznych obciążeń testowych, naukowcy będą mieć dostęp do autentycznych, bogatych danych produkcyjnych do benchmarkowania systemów serwowania. To powinno przyspieszyć innowacje w optymalizacji infrastruktury dla LLM i umożliwić precyzyjniejsze prognozowanie rzeczywistych wyzwań skalowania.