Badacze z dziedziny generacji obrazów borykają się z fundamentalnym problemem: gdy dopasowują modele dyfuzyjne do maksymalizowania wskaźników nagród, generatory przestają tworzyć różnorodne obrazy i zaczynają produkować monotonne, powtarzające się artefakty. Ten "mode collapse" wynika z faktu, że post-trening z nagrodami skupia całą masę probabilistyczną na kilku trybach faworyzowanych przez funkcję nagrody.
Dotychczasowe rozwiązania polegały na dodawaniu zewnętrznych sygnałów - modyfikowaniu samej nagrody, dodawaniu regularyzacji lub zmianie kodera tekstu. Propozycja ReNFT bierze inny kierunek: zamiast ingerować z zewnątrz, pracuje wewnątrz samego modelu. Klucz do sukcesu to obserwacja, że post-trening głównie przemieszcza probabilistyczną masę pomiędzy możliwościami już nauczonym podczas pretreningu, zamiast tworzyć nowe treści. Oznacza to, że utraci różnorodność to nie usunięcie zdolności, lecz ich tłumienie - i można je przywrócić.
Metoda ReNFT najpierw identyfikuje tak zwane "anti-hub" prompty, gdzie uprzedzenia niezależne od tekstu łatwiej ujawnić. Następnie generuje sparowane propozycje z tego samego promptu poprzez dwa różne szlaki - jeden sonduje zamrożony kierunek bazowy w poszukiwaniu uśpionych alternatyw, drugi ekspozycje bezwarunkowy trend z post-treningu. Ranking nagród z adaptacyjnym strażnikiem przydzielenia przyciągającego i odpychającego, a wspólna aktualizacja NFT realizuje naprawę. Wyniki pokazują, że ReNFT zachowuje 98,9 procent nagrody PickScore i 99,0 procent GenEval, jednocześnie poprawiając różnorodność o 58,8 i 55,0 procent.