Badacze zaproponowali multiobjektywny framework do prognozowania ryzyka opuszczenia szkoły przez studentów, integrując uczenie ze wzmacnianiem, wieloinstancyjne uczenie maszynowe oraz zaawansowane techniki wyrównywania bias. Każdy student reprezentowany jest jako zbiór słabo oznaczonych interakcji edukacyjnych, a agent RL wybiera najinformatywniejsze instancje do klasyfikacji. Do kontroli kompromisu między wydajnością a uczciwością (mierzoną metryką Equalized Odds) zastosowano preference-conditioned hypernetworks.
Zmierzone wyniki ujawniają ograniczenia podejścia. Choć bazowy model RL-MIL wykazał silną wydajność klasyfikacyjną, obie warianty hipersieci cierpią na efekt zwany mode collapse - zmiana wagi preferencji nie powoduje systematycznego ruchu wzdłuż zamierzonej granicy uczciwości-wydajności. Przyczyny niepowodzenia to dominacja niektórych celów optymalizacyjnych, słaba propagacja gradientów przez mechanizm uwarunkowania oraz złożite interakcje między dynamicznie generowanymi parametrami sieci.
Badanie dowodzi, że cele dotyczące uczciwości można włączyć w przejrzysty pipeline RL-MIL, ale samo warunkowanie preferencji nie gwarantuje kontrolowalnego zachowania wielocelowego. Wyniki sugerują potrzebę bardziej zaawansowanych podejść do projektowania systemów fair ML, zwłaszcza w kontekście edukacyjnym, gdzie przezroczystość i brak dyskryminacji są kluczowe dla sensownych interwencji.