Naukowcy stworzyli pierwszy benchmark do klasyfikowania kanonów interpretacyjnych na poziomie zdań z orzeczeń Niemieckiego Federalnego Trybunału Konstytucyjnego. Benchmark operacjonalizuje koncepcję interpretacji zaproponowaną przez Larenza w tradycji Savigny'ego, dzieląc ją na siedem binarnych kryteriów klasyfikacji.
Badanie objęło przetestowanie czterech modeli LLM pochodzących z trzech różnych rodzin. Naukowcy porównali wyniki uzyskane przy użyciu ręcznie napisanych promptów ekspertów z promptami zoptymalizowanymi algorytmem Genetic-Pareto (GEPA). Średnia wartość F1 dla siedmiu podtasków wyniosła od 70,4 do 79,2 procent w zależności od modelu. Analiza wykazała, że interpretacja gramatyczna była najłatwiejsza do identyfikacji przez modele, podczas gdy interpretacja systemowa okazała się najtrudniejsza. Ciekawie, GEPA-zoptymalizowane prompty nie osiągnęły systematycznie lepszych wyników niż prompty ręcznie napisane przez ekspertów, co sugeruje, że eksperckie instrukcje stanowią już solidne baseline dla tego zadania.
Ten benchmark ma istotne znaczenie dla oceny możliwości AI w analizie złożonego rozumowania prawniczego. Tradycyjnie interpretacja orzeczeń sądowych pozostawała jednym z najtrudniejszych wyzwań dla dużych modeli języka, a opracowanie ustrukturyzowanego zbioru testowego umożliwia bardziej precyzyjną ocenę tego, gdzie współczesne modele mają braki w rozumieniu strategii prawniczego argumentowania.