Naukowcy opracowali DomainPilot - system optymalizacji mieszanki danych treningowych, który rozwiązuje problem efektywnego fine-tuningu dużych modeli językowych bez konieczności przerywania procesu szkolenia. Tradycyjne metody dynamicznego planowania danych napotykają poważne wyzwania: wybór danych wymaga kosztownych obliczeń na skalę terabajtów, optymalizacja mieszanki powoduje wąskie gardła we wczytywaniu danych lub wymaga trenowania pomocniczych modeli referencyjnych, a strategie przeważania na poziomie próbek opierają się na sygnałach straty, które mieszają szum, trudność i nowość.
DomainPilot wprowadza monitoring strat na poziomie tokenów dla poszczególnych domen w trakcie trenowania, rejestrując dynamikę uczenia się bez zatrzymywania potoku danych. System działa w dwóch fazach: etap coarse optimization wykorzystuje prawa skalowania do dopasowania krzywych konwergencji specyficznych dla domeny i wyprowadza teoretycznie uzasadniony prior do korekcji mieszanki. Następnie etap fine optimization guided mixingiem modeluje efekty interakcji między domenami poprzez kontrolowane eksperymenty. Cała architektura opiera się na podejściu patch-based, które wstrzykuje domenowo-świadomą kalkulację strat do istniejących frameworków (takich jak MindSpeed lub Megatron-LM) przy użyciu zaledwie około 30 linii specyficznego dla frameworku kodu adaptera.
Walidacja przeprowadzona na modelu Qwen3-1.7B podczas supervised fine-tuningu wykazuje znaczną poprawę efektywności trenowania. To podejście ma szczególne znaczenie dla przemysłowych aplikacji, gdzie dane treningowe mają skomplikowaną strukturę i pochodzą z wielu źródeł - DomainPilot pozwala na automatyczne dostrojenie składu danych bez dodatkowych obciążeń obliczeniowych, a jednocześnie zachowując kompatybilność z istniejącymi infrastrukturami treningowymi.