Wybór optymalnego podzbioru danych treningowych dla dużych modeli języka to kluczowy problem - pozwala na znaczne obniżenie kosztów obliczeniowych bez pogorszenia wydajności modelu. Problemy istniejących metod selekcji polegają na tym, że mierzą one różnorodność danych bezpośrednio w przestrzeni wektorów tekstowych, gdzie metryki geometryczne mieszają dominujące kierunki semantyczne, drobne różnice w superwizji i szumy lokalne.
Proponowana metoda MASS reformułuje problem jako hierarchiczny problem pokrycia - najpierw identyfikuje główne grupy semantyczne w danych za pomocą gęstego autoenkodera, który uczy się niskowymiarowych współrzędnych na rozmaitości głównej. Następnie w ramach każdej grupy dokonuje selekcji uwzględniającej jakość, stosując TopK rzadki autoencoder do wybrania najbardziej reprezentatywnych próbek. To podejście coarse-to-fine pozwala na bardziej precyzyjne wychwytywanie zarówno semantycznych różnic jak i bardziej subtelnych aspektów danych.
Wyniki na modelach Vision Flan i LLaVA-CoT są obiecujące - MASS konsekwentnie przewyższa istniejące metody selekcji danych na różnych budżetach treningowych. Kluczowym odkryciem jest to, że można osiągnąć wydajność równą treningowi na pełnych zbiorach danych, używając zaledwie małego podzbioru wybranych próbek. To ma istotne znaczenie praktyczne dla organizacji trenujących duże modele, ponieważ może drastycznie zmniejszyć zasoby obliczeniowe potrzebne do uzyskania porównywanych wyników.