Hugging Face przeprowadziła eksperyment, w którym na tej samej infrastrukturze klastra obliczeniowego zmieniono jedynie porządek wykonywania zadań trenowania modeli AI. Rezultatem była poprawa wykorzystania zasobów o 33 punkty procentowe - znaczący wzrost uzyskany bez zakupu dodatkowego sprzętu czy modyfikacji istniejących systemów.
Zmiana dotyczyła algorytmów harmonogramowania i szeregowania zadań w kolejce. Zamiast tradycyjnego podejścia first-in-first-out, zespół zoptymalizował przydzielanie zasobów GPU i pamięci tak, aby minimalizować okresy przestoju i fragmentacji. Problem polegał na tym, że duże zadania często czekały na wystarczającą ilość wolnych zasobów, podczas gdy mniejsze mogły być wykonywane równolegle z większą wydajnością.
Znaczenie tego odkrycia sięga poza sam Hugging Face. Centra danych obsługujące trenowanie modeli i inference wydają ogromne sumy na infrastrukturę, a nawet kilkadziesiątkowe procentowe wzrosty efektywności mogą przełożyć się na miliony dolarów oszczędności. Wynik pokazuje, że optymalizacja oprogramowania harmonogramującego może być szybszym i tańszym rozwiązaniem niż skalowanie, a w branży AI - gdzie popyt na moc obliczeniową znacznie przewyższa podaż - każdy procent efektywności ma wagę biznesową.