Badacze z arXiv odkryli fundamentalną rozbieżność między tym, jak duże modele językowo wyrazają niepewność, a tym jak robią to ludzie. Podczas gdy ludzie konsekwentnie łączą słowa takie jak 'possible', 'likely' czy 'very likely' z określonymi poziomami pewności, LLM-y kodują te same wyrażenia ze zupełnie innymi wartościami numerycznymi. Problem polega na tym, że tradycyjne metody pomiaru niepewności modeli AI opierają się głównie na sygnałach wiarygodności lub spójności odpowiedzi, nie na rzeczywistych słownych wyrażeniach niepewności.
Dla AI ważne jest umieć wyrazić, gdzie ma braki w wiedzy - to kluczowe dla bezpieczeństwa i zaufania do systemów. Z perspektywy kognitywnej, dokładna werbalizacja niepewności odzwierciedla metacognitive monitoring, czyli świadomość granic własnej wiedzy. Naukowcy stworzyli nowy algorytm optymalizacyjny METHODNAME, który zamiast polegać na powtarzanym próbkowaniu, bezpośrednio uczy się optymalnego mapowania między markerami niepewności a rzeczywistymi wyjściami modelu. Algorytm dopasowuje znaczenie każdego słowa niepewności w taki sposób, aby najlepiej wyjaśniać empiryczną poprawność odpowiedzi modelu.
To podejście umożliwia precyzyjne porównanie na poziomie pojedynczych wyrażeń między semantyką pewności u ludzi i LLM-ów. Odkrycie sugeruje, że gdy model mówi 'very likely', wcale nie musi to oznaczać wysokiego poziomu pewności w znaczeniu zrozumiałym dla użytkownika. Takie systematyczne rozbieżności mogą prowadzić do niebezpiecznych sytuacji, w których ludzie błędnie interpretują pewność AI, szczególnie w aplikacjach medycznych, prawnych lub finansowych.