Naukowcy zaproponowali metodę szacowania zaufania do poszczególnych modeli w systemach opartych na wielu dużych modelach językami, zamiast traktować wszystkie modele jako równie wiarygodne. Tradycyjne podejścia do agregowania predykcji z ensemble LLM ignorują fakty, że różne modele mają istotnie różne poziomy niezawodności i kalibracji - niektóre są nadmiernie pewne siebie, inne wciąż niepewne nawet gdy mają rację.
Zamiast tego zespół wykorzystał framework "structured expert judgment" z teorii decyzji, stosując pytania kalibracyjne aby ocenić wiarygodność każdego eksperta na podstawie jakości jego probabilistycznych predykcji. Konkretnie zastosowali logarytmiczne ważenie w stylu Cooke'a, które penalizuje modele nadmiernie pewne siebie, gdy się mylą, i faworyzuje te dobrze skalibrowane. Metoda ta jest inspirowana podejściami stosowanymi w ocenie ekspertów w naukach decyzyjnych.
Badania na benchmark MMLU i MMLU-Pro wykazały, że w jednorodnych panelach modelów różne metody agregowania dają podobne wyniki, ale ważenie Cooke'a staje się krytyczne gdy modele są heterogeniczne lub gdy system zawiera niezawodne eksperdy. Nowe podejście uzyskuje lepszą równowagę między dokładnością a niezawodnością i pozostaje odporne na wprowadzenie słabych modeli. Wyniki sugerują, że właściwa agregacja wielomodelowych systemów wymaga nie tylko łączenia predykcji, ale również dynamicznego kalibrowania zaufania wobec niepewności.