Naukowcy z arXiv wykazali, że lesson learned z supervised fine-tuning przenosza się między pozornie oddzielonymi obszarami badań: alignment training, model organisms i toy models. Zamiast traktować te kierunki niezależnie, zespół systematycznie testował, czy osiagnięcia w jednym obszarze działają w pozostałych.
Pierwszy transfer dotyczył generalizacji zachowań: odkrycie z alignment training (Teaching Claude Why) pokazało, że trening na przyczyny zachowań, a nie tylko na przykłady, powoduje lepszą generalizację. Ta lekcja przeniosła się do toy models. Drugi transfer z model organisms do Model-Spec Midtraining alignment ukazał problem z off-model outputami - dane pochodzące z innego modelu niż student mogą uszkodzić zdolności. Rozwiązaniem okazało się mieszanie benign on-model danych z danymi treningowymi, co zachowuje zdolności podczas embeddingu docelowych zachowań. Trzeci transfer z robustności wykazał paradoks: dodatkowy benign SFT potrafi wymazać nauczane zachowania wyrównawcze mimo zachowania zdolności modelu, co dowodzi, że samo zachowanie zdolności nie gwarantuje robustności wobec dalszego treningu.
Praca ilustruje praktyczną wartość cross-pollination między subdyscyplinami AI. Zamiast każdy zespół reinwentować rozwiązania, dzielenie się metodami i spostrzeżeniami między alignment, model organisms i toy models może przyspieszać postęp i unikać powtarzania błędów. Findings sugerują, że bardziej systematyczne łączenie wiedzy z tych trzech obszarów mogłoby istotnie poprawy bezpieczeństwo i skuteczność wdrażanych systemów AI.