Naukowcy zaproponowali nową metodę condition-anchored generative distillation, która rozwiązuje problem katastrofalnego zapominania w modelach językowych podczas uczenia się nowych zadań. Podejście polega na zatrzymaniu małego zestawu starych pytań, wykorzystaniu zamrożonego poprzedniego modelu do rekonstrukcji odpowiedzi i stanów generacji, a następnie dopasowaniu rozkładów predykcji podczas nauki kolejnego materiału. W przeciwieństwie do tradycyjnego replay, metoda CAGD oddziela trzy role: warunki wybierają zachowanie do ochrony, generacje nauczyciela lokalizują istotne stany, a miękkie cele (soft targets) określają jak mogą zmieniać się predykcje.

W testach na 219-milionowym modelu dyfuzji zamaskowanej straty końcowa strata wahała się od 2.927 do 1.114 dla jednej kolejności zadań, a w kierunku odwrotnym spadła z 2.168 do 0.891. Metoda okazała się bardziej efektywna niż hard replay, obniżając końcową średnią stratę o 0.055. Rezultaty były spójne na świeżych faktach i naturalnych instrukcjach w modelach SMDM i Qwen3.

Na benchmarku GSM8K model Qwen zachowywał zgodność formatu odpowiedzi podczas adaptacji, choć dokładne dopasowanie był mieszany przy wersji 0.6B i pogarszał się przy 1.7B. Stanowi to znaczący krok w kierunku stabilizacji uczenia ciągłego, choć wyniki sugerują, że większe modele wymagają dalszych optymalizacji przy rzeczywistych scenariuszach zastosowania.