Naukowcy z arXiv opracowali RAPID - metodę destylacji relacyjnej która elegancko rozwiązuje problem wysłania wszystkich par przykładów między nauczycielem a uczniem. Problem jest prosty: gdy masz mini-batch, liczba par rośnie kwadratowo, co szybko staje się nieefektywne. Tradycyjne podejście to losowe próbkowanie, ale zmarnuje to budżet relacji na mniej ważne pary.
RAPID oddziela zadanie na dwa poziomy. Najpierw brama niezawodności decyduje które relacje nauczyciela są godne uwagi, opierając się na entropii nauczyciela i residuach między nauczycielem i uczniem. Następnie metoda używa tzw. exact inverse proposal correction żeby sprawić że estymatory straty i gradientu pozostają bezstronne mimo selekcji par. To matematycznie eleganckie podejście zapewnia że uczen uczy się od nauczyciela bez błędu wyboru.
Wyniki empiryczne pokazują konkurencyjność metody. Na AG News z destylacją BERT do DistilBERT przy budżecie 256 relacji RAPID osiągnął 94,241 procent dokładności (plusminus 0,025 procent). Na SST-2 z destylacją DistilBERT do DistilBERT przy budżecie 64 relacji uzyskał 88,685 procent (plusminus 0,462 procent). To wyniki poniżej teoretycznie optymalnego wariantu z pełną bramą niezawodności ale znacznie lepsze niż standardowe podejścia. Badanie pokazuje że inteligentny wybór par może być kluczem do efektywnej destylacji wiedzy w modelach NLP.