Zespół badaczy zaprezentował NL2SHACL-Bench, pierwszy benchmark dedykowany do tłumaczenia wymagań sformułowanych w naturalnym języku na SHACL, standard walidacji RDF knowledge graphs. Problem jest praktyczny: SHACL to kluczowa technologia do sprawdzania poprawności danych w grafach wiedzy, ale jego tworzenie wymaga zaawansowanej wiedzy technicznej, którą posiadają głównie specjaliści, a nie eksperci domenowi.

Benchmark rozwiązuje dwa kluczowe wyzwania. Po pierwsze, nie było dotąd narzędzia do oceny zadania NL2SHACL. Po drugie - ocena wygenerowanych shapów nie może opierać się na prostym porównaniu tekstowym, bo te same wymagania mogą być wyrażone na wiele semantycznie równoważnych sposobów. Badacze przetestowali cztery najnowsze LLM-y używając swojego benchmarku i uzyskali interesujące rezultaty: modele świetnie radzą sobie z generowaniem syntaktycznie poprawnego SHACL, ale mają znaczące problemy z mapowaniem złożonych wzorców logicznych i strukturalnych na semantycznie równoważne ograniczenia.

Wyniki pokazują, że NL2SHACL-Bench stanowi solidny punkt odniesienia do mierzenia postępów w tej dziedzinie. Benchmark otwiera drogę do lepszych modeli, które mogłyby demokratyzować tworzenie walidacji danych poprzez eliminację bariery technicznej - eksperci biznesowi mogliby opisywać wymagania swobodnie w języku naturalnym, a AI automatycznie tłumaczyłoby je na poprawne SHACL.