Zespół badaczy ujawnił fundamentalny problem w metodologii porównywania selektorów w selektywnej destylacji on-policy: wspólna stopa uczenia, którą zaproponowano jako neutralny punkt porównawczy, wcale nie jest neutralna. W eksperymentach przeprowadzonych na Qwen2.5-1.5B (uczeń) i 7B (nauczyciel) przy trenowaniu na GSM8K, okazało się, że gęste uczenie nadzorowane pozostaje statystycznie stabilne w stosunku do zmian stopy uczenia - różnice wyniosły zaledwie 1,8 pp przy p=0,26. Tymczasem każdy ze sprawdzanych selektorów dramatycznie reaguje na zmianę parametru: losowy wybór 5 proc. tokenów przesunął się o 5,4 pp, selektor total-variation o 6,7 pp, a nauczalności aż o 17,7 pp.
Te rozbieżności powodują, że werdykt dotyczący porównania uczenia gęstego z selektywnym zależy bezpośrednio od wyboru stopy uczenia - wynik wynosi 10,1 pp przy lr=1e-4, ale spada do 5,1 pp przy 5e-5, czyli różnica 2,0x decydowana przez parametr, który protokół eksperymentalny traktuje jako nieznaczny szczegół. Dodatkowo dwa z sześciu testów istotności statystycznej między parami selektorów zmieniają wyniki między sąsiednimi stopami uczenia bez jakiegokolwiek przeinwestowania rang. Zjawisko to badacze nazwali entanglement stopy uczenia.
Analiza ujawniła, że problem leży w samym procesie selekcji, a nie w wielkości kroku aktualizacji. Pomimo 15,5x różnic w normach gradientów między wariantami, magnitudy aktualizacji AdamW śledzą zmianę stopy uczenia z dokładnością do 2,2 proc. Wstępnie zarejestrowany eksperyment ablacyjny ze zamrożonym scoringiem selektora wykazał, że dynamiczne ocenianie dodaje 3,79 +/- 1,69 pp wrażliwości na zmianę stopy, ale nawet wariant ze statycznym oceną pozostaje znacznie entanglowany. Odkrycie to sugeruje, że wiele dotychczasowych porównań selektorów w literaturze może wymaga ponownej oceny z uwzględnieniem tej nieoczekiwanej interakcji parametrów.