Nowe badanie na arXiv pokazuje, że destylacja wiedzy - technika transferowania umiejętności z większego modelu do mniejszego - ma sprzeczne skutki dla zmniejszania bias-u w małych modelach językowych. Podczas gdy poprawia ona wydajność na zadaniach jednoznacznych, jednocześnie degraduje precyzję abstencji modelu na pytaniach niejednoznacznych.
W szczegółowych testach zespół zbadał destylację przeprowadzaną z modelu Gemma-2-9B do SmolLM2-1.7B-Instruct. Na zadaniach BBQ z jednoznacznymi odpowiedziami metoda zmniejszyła błędy kontekstowe z 44% do 24% - znaczna poprawa. Jednak na tych samych testach z ambiguosnymi pytaniami model zaczął zwracać stereotypowe odpowiedzi w 15% przypadków, gdzie wcześniej prawidłowo wstrzymywał się od odpowiedzi. Mechanizm ten pojawił się również w modelu OLMo-2-1B-Instruct, gdzie 89% nowych błędów pojawiło się właśnie w postaci wypełnionych odpowiedzi zamiast wstrzymania się.
Przychodzenie do wniosku, że dwa efekty - utrata abstencji i wypełnianie jej stereotypowymi odpowiedziami - działają niezależnie. Korelacja Spearmana między nimi wyniosła zaledwie 0.19, co wskazuje na różne źródła problemu. Głównym winowajcą okazały się dane treningowe: audyt czterech zbiorów danych wykazał, że wstrzymanie się od odpowiedzi pojawia się jako typowy odpowiedź w mniej niż 0,5% przypadków. Próby naprawy poprzez dodanie przykładów wstrzymania się prowadzą do przegięcia, gdzie model odmawia odpowiadania w 99,8% przypadków. Badacze zaproponowali nową metodę diagnostyki - Per-Condition Calibration Diagnosis - która mogłaby ujawnić tego typu asymetryczne problemy przed agregowaniem metryk.