Naukowcy opracowali metodę pomiaru zdolności dużych modeli języka do prawidłowego wagowania informacji z różnych źródeł i stwierdzili, że algorytmy zawodzą na całej linii. Framework Learn2Discern (L2D) sprawdził, czy LLM-y rzeczywiście przypisują większe znaczenie wiarygodnym źródłom (source discernment) i czy poprawiają swoje wcześniejsze poglądy, gdy dostają informacje prowadzące bliżej prawdy (truth discernment). Testy obejmowały 13 modeli LLM z prawie 670 tys. prób eksperymentalnych.
Wyniki są rozczarowujące: modele osiągają wyniki na poziomie przypadku zarówno w source discernment jak i truth discernment. Znowu - są warte dwa razy bardziej zainteresowany źródeł popularnych niż niezawodnych, oraz uaktualnią się tak samo chętnie otrzymując informacje, które pogorszą czy poprawią ich pozycję względem rzeczywistości. Nowsze i większe modele nieco lepiej radzą sobie z truth discernment, ale blind spot w source discernment pozostaje niezmienny niezależnie od wielkości modelu.
Pre-rejestrowane badanie użytkownika z 299 respondentami wykazało, że ludzie rzeczywiście opierają się na tych dwóch wymiarach oceny informacji i że ich naruszenia przez LLM-y zmniejszają zaufanie oraz intencje korzystania z systemów. W opublikowanym przez zespół zbiorze danych i benchmarku znaleziono jednak proste interwencje na etapie inferencji, które mogą poprawić zarówno source discernment jak i truth discernment. To kwestia coraz ważniejsza, ponieważ LLM-y zastępują tradycyjne wyszukiwarki.