Naukowcy zaproponowali metodę BIRD do efektywnej kompresji dużych modeli rozumowania, które rozwiązują problemy poprzez długie łańcuchy myślenia (chain-of-thought). Problem polega na tym, że wiele obliczeń w tych modelach to zbędne wywody, powtórzenia weryfikacji i detury, które nie poprawiają ostatecznego wyniku.

Istniejące metody destylacji samouczenie (self-distillation) próbują zmniejszyć ten koszt, ucząc mniejszy model na skróconej wersji własnych śladów. Jednak podejście to ma wbudowaną wadę - gdy model uczy się tylko na próbkach, które już wygenerował, skoncentrowana jest na kontekstach szumnych i błędnych, gdzie zwięzły nauczyciel może dostarczyć tylko lokalne poprawy.

BIRD rozwiązuje ten problem w dwóch etapach. W pierwszym fazie model generuje zwięzłe rozwiązania pod instrukcją o krótkowości, zachowując tylko te ścieżki, które dają prawidłową odpowiedź, i wykonuje lekkki krok treningu supervised fine-tuning. W drugiej fazie, już z ulepszonego modelu wyjściowego, zastosowana jest destylacja reverse-KL w oparciu o własne, bardziej efektywne próbki. Taki dwuetapowy proces przekształca behawior induowany instrukcją w domyślne zachowanie modelu, co pozwala na znaczną redukcję obliczeń bez utraty precyzji.