Naukowcy z arXiv zaproponowali innowacyjne rozwiązanie problemu czasochłonnego tworzenia kodeksów adnotacji dla dużych zbiorów tekstu. Zamiast prosić ekspertów do przejrzenia wszystkich dokumentów, system identyfikuje miejsca, gdzie różne LLM-y podają różne etykiety, i skupia uwagę specjalistów właśnie na tych kontrowersjnych przypadkach.
Badacze przetestowali trzy podejścia do zbierania informacji zwrotnej od ekspertów: pierwsze polegało na edytowaniu wersji kodeksu zasugerowanych przez LLM-y, drugie na odpowiadaniu na pytania o rozbieżności modeli, trzecie zaś na oznaczeniu spornych przypadków wraz z uzasadnieniami. Eksperyment prowadzony na tysiącach transkryptów sesji nauczania wykazał, że ostatnie podejście - Rationale Labeling - dało najlepsze wyniki z dokładnością 64,9% w porównaniu z etykietami ekspertów. Przewyższyło to zarówno tradycyjnie poprawiane kodeksy (57,8%) jak i inne warianty, w tym Quality Answering (60,5%).
To odkrycie ma praktyczne znaczenie dla sektora zajmującego się adnotacją danych na dużą skalę. Zamiast zatrudniać ekspertów przez wiele miesięcy do ręcznego opracowania kodeksów, organizacje mogą teraz wykorzystać LLM-y do automatycznego flagowania trudnych przypadków i skupić zasoby ludzkie właśnie na nich. Podejście skraca ten proces z miesięcy do dni, utrzymując wysoką jakość wyników - co stanowi istotną optymalizację kosztów i czasu w nowoczesnych pipeline-ach przetwarzania danych.