Naukowcy zaprezentowali BridgeAlign - nowy podejście do wyrównania preferencji modeli językowych dedykowane naukom humanistycznym i społecznym. Problem stanowi fakt, że większość metod syntezy danych dla LLM-ów skupia się na zadaniach z weryfikowalnymi odpowiedziami, ignorując szerokie obszary HSS, gdzie ocena jakości zależy od niuansów i subiektywnych osądów, a nie od obiektywnej poprawności.
BridgeAlign pracuje w trzech etapach. Najpierw zespół kuruje dokumenty HSS ze zbiorów sieciowych poprzez filtrowanie heurystyczne i oparte na LLM-ach oraz rafinację tekstu. Następnie generuje tripiety preferencji - kombinacje trzech odpowiedzi do tego samego pytania - używając techniki inverji instrukcji opartej na personach, z weryfikacją spójności Q&A. Ostatni krok to optymalizacja preferencji: zamiast naiwnych heurystyk porównujących odpowiedzi człowieka z modelem, metoda ugruntowuje preferencje w rubrikach jakości HSS i generuje przejściowe odpowiedzi poprzez kontrolowaną degradację jakości, tworząc pary preferencji blisko granicy decyzyjnej dla precyzyjniejszego rozróżniania jakości.
Wyniki pokazują, że model Qwen3-8B wyrównany za pomocą 210 tys. syntetycznych próbek preferencji osiągnął najlepsze średnie wyniki na 17 benchmarkach w porównaniu z 11 silnymi liniami bazowymi. Kluczowe: metoda jednocześnie liczy między zdolnościami zgodnymi z preferencjami człowieka a znajomością faktów, bez żadnych kompromisów między nimi - co stanowi znaczący postęp w wyrównaniu modeli do złożonych zadań wymagających oceny nuansów i jakości.