Fine-tuning zmienia wewnętrzne reprezentacje LLM-ów, ale te zmiany nie zawsze zachodzą w warstwach zawierających komponenty naprawdę ważne dla wydajności. To kluczowe odkrycie naukowców badających, jak modele dostrajane do konkretnych zadań reorganizują swoją strukturę.

Badacze wykorzystali metodę EAP (Eigenvector Attribution Pruning) do zidentyfikowania komponentów kluczowych dla wydajności - konkretnych attention heads i aktivacji logit-level. Odkryli, że te komponenty są skoncentrowane w określonych warstwach, sugerując pewien stopień lokalizacji funkcjonalnej. Jednak (i to jest zastanawiające) warstwy, które ulegają największym zmianom reprezentacyjnym podczas fine-tuningu, wcale nie pokrywają się z warstwami zawierającymi te kluczowe komponenty. To wskazuje, że model zmienia wiele rzeczy, ale niekoniecznie tam gdzie to naprawdę ma znaczenie.

Najciekawszym znaleziskiem jest efekt negatywnego transferu. Gdy dwa zadania dzielą wysokie pokrycie komponentów EAP - ale są różne w naturze (np. klasyfikacja vs. generowanie tekstu) - fine-tuning na jednym zadaniu pogarsza wydajność na drugim. To oznacza, że współdzielone komponenty nie gwarantują transferu wiedzy, a wręcz mogą być destrukcyjne. Wynik ma implikacje dla strategii dostrajania: zwykłe współdzielenie reprezentacji między zadaniami to za mało, trzeba uwzględniać, czy zadania są komplementarne czy antagonistyczne.