Naukowcy z arXiv opublikowali framework CaRE do oceny modeli dyfuzji maskowanej (MDLM), rozwiązując problem braku standardów oceny w tej szybko rosnącej dziedzinie. Siedem ostatnich prac na temat remaskowania stosowało niekompatybilne ustawienia - różne liczby kroków, metryki i temperatury próbkowania - co uczyniło ich wyniki praktycznie nieporównywalnymi i uniemożliwiło stwierdzenie, czy ulepszenia pochodzą z faktycznych postępów algorytmicznych czy artefaktów ewaluacji.

CaRE standaryzuje ocenę poprzez kontrolę rzeczywistej liczby ewaluacji funkcji (NFE), wymuszanie raportowania wielu metryk i eksplicytne sterowanie stochastycznością. W badaniach siedmiu strategii remaskowania na modelach LLaDA-8B-Base i Dream-7B-Base przy różnych poziomach stochastyczności i budżetach kroków, framework ujawnił, że temperatura odpowiada za większość wariancji metryk MAUVE. Porównania przy równym koszcie obliczeniowym odwróciły ranking kilku wcześniej opublikowanych strategii, a odkrycie to dotyczy również napięcia między remaskingiem poinformowanym a stochastycznym odmaskingiem.

Wyniki wskazują, że hig-entropy remasking zmniejszył MAUVE o 0,296 przy 256 krokach i unmask_temp=0,25 (p=0,020). Leaderboard CaRE obejmuje 12 otwartych modeli MDLM o parametrach od 150M do 8B, potwierdzając, że obserwowana interakcja zachowuje się konsystentnie na różnych architekturach i skalach. Te odkrycia demonstrują, że dotychczasowe praktyki ewaluacji MDLM były nieprecyzyjne, a CaRE stanowi krok do bardziej wiarygodnego porównywania postępu w modelach dyfuzji maskowanej.