Naukowcy opracowali nowy benchmark do testowania zdolności modeli AI do logicznego wnioskowania nad operatorami probabilistycznymi i wyrażeniami niepewności w języku naturalnym. Benchmark zawiera 14320 proceduralno-wygenerowanych promptów angielskich w piętnastu szablonach wnioskowania, systematycznie zmieniając formę pytań, strategie negacji i treść powierzchniową. Badanie obejmowało 29 współczesnych modeli językowych.

Wyniki były znacznie gorzsze niż się spodziewano. Większość modeli wykazała systematyczne uprzedzenia - niezależnie od logicznej struktury problemu, modele preferowały odpowiedzi "tak" lub "nie". Naukowcy wprowadzili pojęcie "competence floor" - miary równej gorszej z dwóch wartości (dokładność na pytaniach gdzie poprawna jest odpowiedź "tak" oraz na pytaniach gdzie poprawna jest "nie") - aby zmierzyć te uprzedzenia. Zaledwie 9 z 29 testowanych modeli przekroczyło wynik losowy.

Badanie ujawniło również szereg błędów systematycznych występujących we wszystkich testowanych osiach - w zależności od formy pytania, użytych czasowników i działań, a także od płci i pochodzenia imion pojawiających się w promptach. To sugeruje, że obecne LLM mają poważne ograniczenia w przeprowadzaniu czystego logicznego wnioskowania, niezależnie od kontekstu. Badanie ma znaczenie szczególnie dla wysokostakowych zastosowań takich jak medycyna czy prawo, gdzie dokładne rozumowanie nad wyrażeniami niepewności jest kluczowe.