Naukowcy opracowali nową metodologię oceny semantycznego zachowania informacji podczas automatycznego tworzenia ontologii z tekstów prawniczych. Metoda porównuje wydajność modeli języka (takich jak GPT) na oryginalnych dokumentach z ich wydajnością na strukturalnych reprezentacjach utworzonych przez systemy ontology learning, z różnicą stanowiącą miarę utraconego znaczenia.
Badanie przeprowadzono na анализie umów fuzji i przejęć - dziedzinie wymagającej precyzyjnego rozumienia skomplikowanego języka prawniczego. Naukowcy testowali sześć różnych modeli języka względem trzech metod tworzenia ontologii. Wyniki wykazały systematyczną utratę semantyczną, która znacznie się różniła w zależności od złożoności zadania rozumowania i kombinacji modelu z metodą - niektóre pary model-metoda radziły sobie znacznie lepiej niż inne.
To odkrycie jest istotne, bo obecne podejścia do oceny ontologii skupiają się wyłącznie na strukturalnej poprawności, ignorując pytanie, czy rzeczywiste znaczenie tekstu przetrwało transformację. Badacze dostarczają praktycznych wytycznych do wyboru optymalnych konfiguracji systemów wiedzy prawniczej, wskazując, że nie wszystkie kombinacje są jednakowo skuteczne w zachowaniu sensu oryginalnych dokumentów.