Naukowcy przedstawili DRET - nową metodę transferu wiedzy, która pozwala wstrzyknąć wiedzę biomedyczną z dużych specjalistycznych modeli do małych modeli ogólnego przeznaczenia bez ponownego trenowania na oryginalnych korpusach. Problem jest rzeczywisty: modele takie jak BioBERT i ClinicalBERT działają doskonale w zadaniach biomedycznych, ale ich rozmiar i wymagania obliczeniowe czynią je niepraktyczni do wdrożenia w wielu rzeczywistych warunkach.
DRET ewoluuje przez kilka iteracji - od strategii merge'owania tokenizera (DRET 1.x) przez hybrydowe uśrednianie embedingów (DRET 2.0), aż do hierarchicznego transferu opartego na priorytetach (DRET 3.x i 4.x). Ostatnia wersja łączy zamrażanie warstwy embedingów, zróżnicowane wskaźniki uczenia, propagację etykiet i funkcje straty świadome nierównowagi klas. Testy przeprowadzono na klasyfikacji PICO w korpusie EBM-NLP, które stanowi saksę zadanie z powodu znacznej nierównowagi klas medycznych.
Wyniki są imponujące: DistilBERT z DRET (66 milionów parametrów) osiąga dokładność, czułość i ROC-AUC porównywalne, a w niektórych metrykach nawet przewyższające modele dziesięciokrotnie większe. To otwiera drogę do praktycznych wdrożeń zaawansowanych modeli NLP w służbie zdrowia, gdzie zasoby obliczeniowe są ograniczone, a wydajność medyczna kluczowa.