Zespół badawczy opublikował IntLawNER, pierwszy obszerny dataset do problemu rozpoznawania nazw (NER) w tekstach kodeksów prawa międzynarodowego. Zbiór obejmuje 2987 zdań i 8094 anotowanych jednostek z trzech kluczowych źródeł: orzeczeń Międzynarodowego Trybunału Sprawiedliwości, rezolucji Rady Bezpieczeństwa ONZ oraz wyroków Europejskiego Trybunału Praw Człowieka, z siedmioma specyficznymi dla instytucji typami jednostek.
Dataset powstał dzięki innowacyjnemu hybrydowemu podejściu, które zaczynało od 468 tysięcy zdań źródłowych i redukowało je do kompaktowego zestawu anotacyjnego poprzez retrieval kandydatów, walidację opartą na LLM-ach i przeglądzie człowieka. Interesująco, 89,6% jednostek ze srebrnej warstwy zostało zaakceptowanych bez zmian, co sugeruje dużą skuteczność wstępnych algorytmów. Jednak analiza pokazała subtelną pułapkę: podczas gdy Cohen's kappa wynosił imponujące 0,964 dla dopasowanych granic, makro-F1 spadało do 0,753 gdy uwzględnić brakujące jednostki, błędy granic i poprawki etykiet.
Benchmark ujawnił znaczące wyzwania dla modeli AI. Model zero-shot GLiNER zawalił się na typach jednostek zależnych od funkcji instytucjonalnej zamiast formy tekstu, osiągając zaledwie 0,243 micro-F1. Transformery fine-tunowane walczą głównie z rzadkimi etykietami. Badanie pokazuje jednak promującą ścieżkę: starannie wybrane przykłady few-shot, które demonstrują kontrast między etykietami, poprawiały wyniki każdego testowanego LLM w stosunku do wariantu zero-shot. To podbija wcześniejsze tezy, że domena prawa międzynarodowego wymaga specjalistycznego podejścia, gdzie znaczenie jednostek płynie z ich roli instytucjonalnej, nie zaś z samego słowa.