Naukowcy przeanalizowali siedem metod szacowania pewności odpowiedzi dla wizyjno-językowych modeli (LVLMs) pracujących z finansowymi wykresami, tabelami i dokumentami. Badanie obejmowało pięć otwartych modeli i cztery warianty zadań z trzech benchmarków wizyjnych poświęconych pytaniom o zawartość finansową, w tym jeden dwujęzyczny. Wszystkie metody były trenowane wyłącznie na zwykłych obrazach i testowane na materiałach finansowych bez dostosowania, co pozwoliło zmierzyć transfer umiejętności między domenami.

Kluczowy problem wykazany w badaniu dotyczy przesadnej pewności modeli. Podczas gdy proste metody inferencji prawidłowo klasyfikują pewne odpowiedzi jako poprawne, drastycznie przeszacowują pewność - błędy kalibracji są zbyt duże, aby można je było usunąć samymi progami decyzyjnymi. Jedynie wytrenowane sondy wewnętrzne mogą wytworzyć wyniki z wiarygodną skalą pewności, która może być praktycznie stosowana w rzeczywistych systemach.

Dodatkowe odkrycia pokazują, że niezawodność szacowania pewności jest strukturalna, a nie uniwersalna - najlepsza metoda zmienia się w zależności zarówno od konkretnego modelu, jak i rodzaju zadania. Żadna metoda nie dominuje więcej niż w ośmiu z dwudziestu kombinacji model-zadanie. Analiza dwujęzyczna ujawniła, że pozorna odporność na język może być artefaktem - rozkład się zmienia, gdy modele analizuje się oddzielnie.