Naukowcy z uniwersytetów opracowali Diffu-LoRA, nową metodę niskorangowej adaptacji (low-rank adaptation) przeznaczoną do personalizacji modeli dyfuzji tekst-na-obraz. Problem jest znany: jak dostosować model do nowych osób lub obiektów z kilku zdjęć referencyjnych, zachowując tożsamość tematu i jednocześnie pozostając wrażliwym na nowe komendy tekstowe?
Tradycyjny fine-tuning całego modelu wymaga trenowania milionów parametrów, co jest obliczeniowo kosztowne. Metoda LoRA zmniejsza tę liczbę przez niskorangowe adaptery, ale pojawiła się nowa zagadka: jak rozdzielić pojemność tych adapterów między różne warstwy sieci? Diffu-LoRA odpowiada poprzez wprowadzenie "inteligentnych bramek" - nauczalnych parametrów przydzielających wagę każdej warstwie. System używa dwupoziomowej optymalizacji na oddzielnych zbiorach danych oraz progresywnego przycinania, usuwając komponenty o najniższych wartościach bramek.
Eksperymenty na modelu Stable Diffusion pokazały, że podejście to osiąga lepszą wierność tematu i zgodność z promptem niż oceniane metody bazowe. Ablacyjne badania potwierdzają, że uczenie się optymalnego rozkładu rangi stanowi praktyczne rozwiązanie dla efektywnej parametrycznie personalizacji modeli dyfuzji - szczególnie istotne dla zastosowań wymagających dostosowania do wielu użytkowników bez ogromnych kosztów obliczeniowych.