Naukowcy z arXiv publikują position paper, w którym kwestionują tradycyjny sposób oceny błędów halucynacyjnych w modelach języka dedykowanych prawie. Zamiast traktować halucynacje jako proste błędy faktyczne lub problemy z cytowaniem, autorzy proponują oceniać je jako "failure of legal warrant" - brak właściwego uzasadnienia prawnego dla sformułowanych tez.
Kluczowym pojęciem jest claim-authority warrant, definiowany jako wrażliwa na kontekst relacja między znaczącą tezą prawną a autorytetem prawnym, który rzeczywiście istnieje, ma zastosowanie w danej jurysdykcji, jest aktualny na dzień analizy i wspiera przedmiot asercji. System powinien nie tylko podać prawo, ale również właściwie je uzasadnić - może odpowiedzieć na pytanie, zawęzić, zadać dodatkowe pytanie, ostrzec przed fałszywą przesłanką lub powstrzymać się od odpowiedzi. Pilotażowe testy pokazują, że metryki warrant wykazują materialne problemy, których mogą przegapić popularne benchmarki takie jak LegalHalBench czy CitaLaw.
Badacze specyfikują konkretny program badawczy obejmujący standardowe rekordy benchmarków, granice twierdzeń, etykiety wsparcia, polityki scoringu dla mieszanych odpowiedzi, wagi ryzyka, raportowanie niezawodności adnotacji oraz ontologie autorytetów specyficzne dla jurysdykcji. Celem jest stworzenie systemu oceny modelów AI w prawie, który sprawdzałby, czy konsekwentne tezy są rzeczywiście licencjonowane przez prawo.