Zespół badawczy opracował Multi-Mask Diffusion Model (MultiMDM), który rozwiązuje problem szybkiej generacji tekstu w modelach dyfuzji maskowanej. Dotychczasowe masked diffusion models (MDM) osiągały wysoką jakość, ale wymagały wielu kroków iteracyjnych, ponieważ wszystkie trajektorie w procesie forward kończyły się w jednym pełnie zamarkowanym stanie, nie pozostawiając przestrzeni do few-step generation.

Nowoczesne alternatywy oparte na uniform-state diffusion wprawdzie unikały tego problemu, ale komplikowały rozróżnianie czystych tokenów od szumu, co pogorszało zarówno jakość modelowania, jak i efektywność treningu. MultiMDM zachowuje jednak strukturę masking, kierując każdy czysty token do wyznaczonej maski i stopniowo mieszając go z zestawem masek. Proces wsteczny zyskuje tym samym zdolność drafting, gdzie model najpierw przewiduje wyznaczoną maskę, a następnie refasuje ją do czystego tokenu.

Badacze wyprowadzili zamkniętą formę ELBO dla treningu MultiMDM, która pozwala na kontinualny training z pretrenowanych modeli MDM. Dodatkowo opracowali dyskretny schemat consistency distillation ze wspólnym sprzęgiem Gumbel do redukcji entropii ścieżki. Eksperymenty wykazały, że MultiMDM stanowi solidną podstawę do principled few-step generation i otwiera perspektywy dla praktycznych zastosowań wymagających szybkiej inferencji.