Naukowcy z arXiv przedstawili nową metodę SatisDive do generowania wielu obrazów z jednego tekstu, która jednocześnie optymalizuje jakość poszczególnych obrazów i ich wzajemną różnorodność. Problem, który rozwiązuje, jest prosty ale ważny: gdy model generuje kilka wariantów obrazu do tego samego prompta, każdy powinien być zadowalającej jakości, ale jednocześnie obrazy powinny się różnić między sobą, aby użytkownik miał rzeczywisty wybór.
Istniejące podejścia mają dwie główne wady. Niektóre optymalizują jakość i różnorodność osobno, co utrudnia znalezienie optymalnego balansu. Inne łączą oba cele w jeden wynik - ale wtedy wysoka różnorodność może zrekompensować niską jakość którychś obrazów, co nie jest pożądane. SatisDive wprowadza concept "satisficing": każdy obraz musi osiągnąć minimalny próg nagrody (reward floor), a cała partia musi spełnić wymóg różnorodności. Wariantując wysokość tego progu, otrzymujemy granicę Pareto pokazującą wszystkie optymalnie zbalansowane kombinacje.
Metoda działa tylko podczas inferencji bez potrzeby dodatkowego treningu. Testy na zbiorze Pick-a-Pic wykazały znaczne улучszenia: z modelem FLUX.1-dev poprawa wyniosła do 0.43 punktu nagrody dla najsłabszego obrazu w zestawie, a z SANA-1.6B nawet do 0.70 punktu w porównaniu z metodą FK steering. Krzywa satysdyversyjna SatisDive dominuje inne podejścia w ich wspólnym zakresie wyników, co oznacza, że oferuje lepszy kompromis między jakością i różnorodnością na wszystkich poziomach optymalizacji.