Badacze z arXiv testowali popularną w AI prawniczym ideę: czy łączenie kilku narzędzi do pomiaru niepewności w jeden pipeline polepszy przewidywanie wyroków sądowych. Pracowali z 1000 rzeczywistych spraw z Europejskiego Trybunału Praw Człowieka, próbując przewidzieć czy Trybunał stwierdził naruszenie Konwencji. Testowali trzy podejścia na modelach Claude Opus 4.8 i GPT-5.5: surowy LLM, LLM przepuszczony przez fusion pipeline oraz baseline oparty na częstości wyrazów w tym samym pipeline'u.

Wyniki były zaskakujące. Na dyskryminacji AUROC wyniosło około 0.83, ale fusion pipeline w ogóle nie poprawił wyników w stosunku do surowego modelu czy baseline'u. Gorzej - naiwne połączenie LLM z metodami Bayesowskiego aktualizowania szans oraz kombinacją Dempster-Shafera podwoiło błąd kalibracji (z około 0.16 do 0.46), bo te metody oparte były na przesłankach statystycznych niezgodnych z probabilizmem LLM. Metoda Dempster-Shafera okazała się wręcz niebezpieczna na długszych łańcuchach - model ufnie przydzielał błędne etykiety z dokładnością poniżej poziomu przypadku.

Rzeczywista wartość pipeline'u okazała się całkowicie inna niż się spodziewano. Gdy połączyli go z warstwą predykcji konformalnej (conformal selective-prediction), system mógł inteligentnie decydować które sprawy są wystarczająco pewne by zautomatyzować, a które należy eskalować do prawnika do przeglądu. To operacyjne zastosowanie - a nie zwiększona precyzja - stanowi rzeczywisty benefit całej konstrukcji dla praktycznego systemu wspomagającego decyzje sądowe.