Algorytmy uczenia się statystycznego do wnioskowania preferencji ludzi napotykają fundamentalny problem: alternatywy wyboru różnią się wieloma cechami jednocześnie, przez co trudno określić, które faktory wpłynęły na decyzję. Istniejące modele są dodatkowo opaque - operatorzy nie mogą sprawdzić, czy model się myli. Nowa metoda Weights to Words rozwiązuje ten problem poprzez automatyczne odkrywanie wymiarów preferencji opisanych w naturalnym języku i powiązanych z wektorami w przestrzeni reprezentacyjnej modelu.
Metoda jest uniwersalna i została przetestowana na czterech różnych domenach: dylematach moralnych, wyborze filmów, winiach i odpowiedziach modeli LLM. Każdy wymiar preferencji jest opisany w zrozumiałych dla człowieka słowach, co pozwala użytkownikom inspekcjonować i edytować wnioski modelu w rzeczywistym czasie. To ma szczególnie znaczenie w przypadkach, gdy model popełnia błędy lub gdy potrzebna jest korekcja jego interpretacji.
Dwa zarejestrowane badania z udziałem ludzi - jedno z 450 uczestnikami dotyczące dylematów moralnych i drugie z 449 osobami na temat selekcji filmów - wykazały rzeczywiste korzyści tej metody. Regularyzacja modelu preferencji w kierunku odkrytej bazy wymiarów zwiększa dokładność predykcji na zbiorach testowych, jednocześnie czyniąc model bardziej przejrzystym i możliwym do kontrolowania przez człowieka.