Hugging Face przedstawiła nową implementację asynchronicznego GRPO z LoRA, która rezygnuje z NCCL - typowego rozwiązania do komunikacji między węzłami GPU. Zamiast tego architektura opiera się na trzech kluczowych komponentach: bucket'cie do magazynowania stanów modelu, proxy do pośredniczenia komunikacji między procesami oraz asynchronicznym przetwarzaniem gradientów.
Nowa metoda ma znaczący wpływ na dostępność trenowania: pozwala na szkolenie modeli na rozproszonej infrastrukturze bez skomplikowanej konfiguracji NCCL, którą tradycyjnie trudno jest skonfigurować na niektórych środowiskach. LoRA - technika zmniejszająca liczbę parametrów do fine-tuningu - robić to jeszcze bardziej wydajnym pamięciowo. GRPO z kolei to nowsza metoda optymalizacji polityki, która lepsiej skaluje się na większych zbiorach danych niż wcześniejsze podejścia.
Ta implementacja zmienia grę dla użytkowników Hugging Face Jobs, którzy chcą trenować własne modele bez głębokich kompetencji infrastrukturalnych. Asynchroniczna natura oznacza również, że węzły mogą pracować niezależnie, co poprawia tolerancję na niestabilne połączenia sieciowe i zmienną latencję - ważne dla trenowania w chmurze publicznej.