Naukowcy ujawnili istotny błąd metodologiczny w porównywaniu parametrów-efektywnych technik fine-tuningu: używanie wspólnego learning rate'u dla komponentów o różnych liczbach parametrów może sztucznie faworyzować rozwiązania z mniejszą liczbą parametrów trenowalnych. W konkretnym przypadku kompresji SVD-based KV-cache - gdzie już wytrenowany model konwertuje się do low-rank cache poprzez faktoryzację wag na encoder (down-projection) i decoder (up-projection) - przy wspólnym rate'u zamrożenie dekodera i dostrajanie tylko enkodera wyglądało jak wyraźne zwycięstwo. Problem pojawił się, gdy każdy komponent otrzymał swój własny dostrojony learning rate.
Wyniki eksperymentów pokazały, że encoder-only healing osiąga parytet z alternatywnymi podejściami, gdy prawidłowo dostroją się learning rate'y. To rozwiązanie oferuje znaczące praktyczne korzyści: 3 razy mniej parametrów trenowalnych i 3 razy mniej pamięci na stan optymalizatora w porównaniu z innymi wariantami. Badania weryfikowano na modelu vision-language (Qwen2.5-VL-3B-Instruct) oraz na modelach text-only, używając trzech różnych seed'ów na konfigurację.
To odkrycie ma szersze znaczenie dla całej wspólnoty ML: sugeruje, że wiele opublikowanych porównań efektywnych technik fine-tuningu może być obciążonych podobnym problemem metodologicznym. Prawidłowe dostrajanie learning rate'ów dla każdej konfiguracji jest kluczowe do wyciągania uczciwych wniosków, zwłaszcza gdy porównuje się metody o istotnie różnych wymaganiach parametrycznych.