Naukowcy przeprowadzili systematyczną ewaluację 12 modeli otwartych z instrukcjami na sześciu wzorcowych grafach przyczynowych, testując pięć strategii promptowania i cztery źródła pewności. Ich analiza pokazała, że osądy LLM dotyczące przyczynowości są zdominowane przez recall - modele przewidują zbyt gęste grafy zawierające wiele fałszywych krawędzi, a zmiana promptów przesyła głównie kompromis między precyzją a recall, nie rozwiązując problemu nadmiernego przewidywania.
Kluczowym problemem jest to, że modele języka w 40% przypadków błędnie klasyfikują pośrednie związki, a w 36% jako bezpośrednie krawędzie błędne orientacje, podczas gdy tradycyjne szacunki wiarygodności są zawodne. Jeszcze bardziej niepokojące jest to, że 80,8% i 84,6% tych fałszywych dodatnich predykcji otrzymuje wyrażoną pewność na poziomie co najmniej 80%, ujawniając znaczną nadmierną pewność w strukturalnie niepoprawnych predykcjach.
Badanie sugeruje, że choć LLM potrafią przechwytywać powiązania przyczynowe, nie radzą sobie z wiarygodnym określeniem bezpośredniości i orientacji związków. Dobrą wiadomością jest to, że zgodność między modelami i wieloma promptami oferuje bardziej obiecujący sygnał pewności niż tradycyjne metody logit-based, które często osiągają wartości bliskie 1,0 niezależnie od rzeczywistej dokładności. To odkrycie ma znaczenie dla badaczy wykorzystujących LLM jako źródło wcześniejszej wiedzy przy automatycznym odkrywaniu struktury przyczynowej.