Naukowcy z arXiv opracowali framework do automatycznego identyfikowania, gdzie w dokumentach są wymieniane zbiory danych z zakresu badań nad przesiedleniami i konfliktami. Problema polega na tym, że takie wzmianki są rozproszone po artykułach naukowych, raportach humanitarnych i dokumentach projektów, co utrudnia śledzenie rzeczywistego wykorzystania danych i odkrywanie luk w ich dostępności.
Zaproponowane rozwiązanie nie wymaga ręcznego etykietowania dużej ilości tekstu. Najpierw lekki model, wytrenowany na ogólnej literaturze badawczej, generuje kandydatów na wzmianki danych z nieoznaczonych dokumentów domeny. Następnie frontier LLM przegląda te kandydatów w kontekście, potwierdzając lub odrzucając je oraz korygując granice ekstrakcji. Wynikowe adnotacje są uzupełniane syntetycznymi i kontrastowymi przykładami, a następnie lekki model jest fine-tunowany do pracy na dużą skalę.
W testach na niezależnym zbiorze 1706 fragmentów dokumentów naukowo-humanitarnych model osiągnął 74,1 proc. precyzji i 70,5 proc. recall na poziomie wzmianek. To ma praktyczne znaczenie dla organizacji humanitarnych i badaczy zajmujących się konfliktami, którzy dzięki temu mogą lepiej zarządzać danymi, śledzić ich przepływ i planować zbieranie nowych zasobów.