Naukowcy z obszaru przetwarzania języka naturalnego opracowali nowatorskie podejście do detekcji seksizmu online, które uwzględnia subiektywność zadania anotacji. Problem polega na tym, że obecne systemy zbyt upraszczają wielokrotne osądy anotatorów, redukując je do pojedynczej decyzji większościowej i traktując wszystkie przykłady jednakowo. Zespół zaproponował RA-DPO (Reliability-Aware Direct Preference Optimization), które integruje trzy kluczowe sygnały: zgodę między anotatorami, pewność modelu oraz niepewność na poziomie tokenów, łącząc je w jeden wskaźnik wiarygodności.
Algorytm wykorzystuje ten wskaźnik na dwóch etapach. Podczas trenowania wybiera pary preferencji o największej wartości, co pozwala na znaczne zmniejszenie ilości danych potrzebnych do trenowania - osiągając wyniki identyczne z pełnym zestawem danych przy użyciu zaledwie 30 proc. najwiarygodniejszych przykładów. Na etapie inferencji system może powstrzymać się od predykcji dla trudnych przypadków, co pozwala na wymianę zasięgu za dokładność. W eksperymentach na 6920 wielojęzycznych postach z konkursu EXIST 2023, gdzie badacze fine-tunowali bazę GPT-4o za pomocą DPO i walidowali na otwartych modelach 3-miliardowych parametrów (Llama i Qwen), osiągnięto imponujące wyniki: 96,2 proc. dokładności przy 50 proc. pokryciu w ustawieniu z rzeczywistą zgodą anotatorów i 88,7 proc. w praktycznym ustawieniu przewidywanej zgody.
Znaczenie tej pracy leży w bezpośredniej odpowiedzi na wyzwanie nieodłącznie związane z subiektywną naturą detekcji seksizmu. Tradycyjne podejścia ignorują fakt, że ludzie nie zawsze się zgadzają, co jest ważnym sygnałem sam w sobie. Przez włączenie tej niepewności do procesu trenowania i wdrażania modelu, RA-DPO oferuje bardziej niezawodne rozwiązanie dla wrażliwych aplikacji, jednocześnie zmniejszając koszt obliczeniowy i pozwalając na bezpieczne wdrożenie z możliwością rezygnacji z predykcji gdy model nie jest wystarczająco pewny.