Naukowcy z arXiv pokazali, że dostrojone modele języka mogą wyodrębniać informacje o wskaźnikach zagrożenia z niestrukturalnych raportów policyjnych, ale wymaga to starannego podejścia i sprawdzenia człowieka. Zespół przeanalizował blisko 3000 anonimowych raportów z brytyjskiej jednostki policji, szukając oznak problemów zdrowia psychicznego, uzależnienia od substancji, alkoholizmu i bezdomności. Odkryli, że wskaźniki problemów psychicznych pojawiały się w około 20 procentach interwencji, podczas gdy inne zagrożenia były rzadsze.
Jednak surowe wdrożenie LLM okazało się niestabilne i zawodne. Klasyfikacja w jednym przebiegu dawała niespójne wyniki, a zsumowane dane z modelu systematycznie przeszacowywały liczbę wskaźników zagrożenia w porównaniu z oceną człowieka. Naukowcy musieli zastosować metodę wieloetapową łączącą wielokrotne wnioskowanie modelu, agregację wyników, szczegółową recenzję człowieka i korekcję statystyczną.
Badanie ma znaczenie dla brytyjskiej policji, która rozważa wykorzystanie AI do lepszego zrozumienia, ile działań operacyjnych dotyczy osób w stanie zagrożenia. To mogłoby wpłynąć na alokację zasobów i szkolenia. Wyniki podkreślają jednak, że automatyczne systemy AI w tak wrażliwych zastosowaniach nie mogą pracować samodzielnie bez znaczącego wkładu specjalistów i kontroli danych. System został wdrożony na lokalnie hostowanym modelu otwartego kodu, co jest ważne ze względu na bezpieczeństwo danych w środowisku policyjnym.