Zespół badawczy opracował nową strategię post-treningową o nazwie Skill Training, która zmienia sposób, w jaki duże modele językowe uczą się złożonych procedur. Dotychczas parametry modelu optymalizowano niezależnie od procedur wspierających, które powstają dopiero podczas wnioskowania - to powodowało, że modele miały problemy z automatycznym nabywaniem zaawansowanych strategii rozwiązywania zadań.
W proponowanym podejściu proceduralne scaffoldy są reprezentowane jako ewoluujący graf, który rozwija się równolegle z parametrami modelu poprzez trzy procesy: odkrywanie nowych umiejętności, destylację (przenoszenie wiedzy do parametrów) i dynamiczną rekompilację struktur. To pozwala na tighter integrację między tym, co model uczy się parametrycznie, a procedurami, które wykonuje.
Na benchmark FeatureBench metoda przyniosła bardzo konkretne wyniki: automatycznie odkryte umiejętności zwiększyły wskaźnik sukcesu o 8,1 punktu procentowego, a po destylacji model nadal osiąga 27,7% sukcesu bez żadnych zewnętrznych wsparć (co stanowi 85,2% retencji umiejętności). To znacznie przewyższa standardowe fine-tuning na tych samych danych. Odkrycie sugeruje, że bardziej zintegrowane podejście do treningowe może być kluczowe dla efektywnego nauczania modeli złożonych procedur.