Naukowcy z dziedziny przetwarzania języka naturalnego opracowali ConstructCIE, nowy dataset do automatycznego wyodrębniania informacji o przyczynach wypadków z raportów budowlanych OSHA. Problem stanowi fakt, że przyczyny wypadków w tych dokumentach są zwykle rozproszone, niejawne i rozciągają się na długie fragmenty tekstu, co utrudnia modelem AI ich identyfikację.

Dataset wykorzystuje schemat hierarchiczny obejmujący cztery poziomy informacji: typy wypadków, główne czynniki przyczynowe, czynniki podrzędne i fragmenty tekstu będące dowodem. Badacze przetestowali zarówno tradycyjne modele sequence taggerów jak i nowoczesne duże modele językowe (LLM) dostrajane za pomocą instrukcji. Rezultaty pokazały, że większość modeli dobrze radzi sobie z klasyfikacją typu wypadku i wychwytuje ogólne znaczenie przyczynowe, jednak pozostają ograniczone w precyzyjnym wyodrębnianiu dokładnych granic fragmentów tekstu.

Analiza wykazała również istotne różnice między strategiami ekstrakcji - podejście hierarchiczno-sekwencyjne (JHE) osiągało lepsze wyniki w dokładnym dopasowaniu fragmentów, podczas gdy podejście wielowykładnicze (IHE) czasami przewyższało je w miarach F1. Jednak obie strategie borykały się z błędami przy wyborze dowodów i określaniu granic fragmentów tekstu. Badanie podkreśla, że niezawodna ekstrakcja informacji przyczynowych z raportów wypadków wymaga głębszego zakorzenienia w wiedzy o domenie budowlanej i bardziej zaawansowanych technik wyodrębniania dowodów.