Naukowcy z arXiv opublikowali Data-DPO, metodę, która zmienia podejście do wyboru danych treningowych dla dużych modeli językowych. Zamiast traktować wartość danych jako stałą właściwość, metoda bierze pod uwagę, jak dobrze konkretne dane pasują do możliwości trenowanego modelu.

Data-DPO działa w trzech krokach. Najpierw przeprowadza jednoetapowe testowanie, obserwując, jak model reaguje na różne próbki danych. Następnie przekształca różnice w aktywacjach neuronu w preferencje między parami danych i trenuje lekki model nagród, który uczy się rozumieć, które dane są najbardziej wartościowe dla konkretnego modelu. W ostatniej fazie łączy preferencje modelu, zewnętrzne oceny jakości i różnorodność marginalne, aby skonstruować bardziej stabilny zestaw treningowy.

Wyniki eksperymentów na zbiorach danych Vision-Flan i LLaVA-CoT pokazują, że Data-DPO konsekwentnie przebija istniejące metody selekcji danych przy różnych limitach budżetu treningowego. Co ważne, metoda osiąga wydajność przewyższającą trening na pełnym zbiorze danych, co oznacza znaczną redukcję kosztów obliczeniowych bez kompromisu w jakości modelu. Jest to istotne dla instytucji, których stać na mniejszą skalę treningu przy zachowaniu wysokiej wydajności.