Naukowcy opracowali CASE - nowy combiner selekcji dynamicznej, który rozwiązuje problem fuzji informacji w czasie testowania dla dużych modeli językowych. Zamiast polegać na głosowaniu większościowym odpowiedzi generowanych przez model LLM, metoda trenuje liniową bramę działającą na ukrytych stanach tokena odpowiedzi i wybiera kandydata z najwyższym wynikiem.

Głównym przełomem jest wprowadzenie miary o nazwie decodability - nowego wskaźnika wolnego od przecieków danych, który mierzy jak dobrze bramka klasyfikuje prawidłowe odpowiedzi jako lepsze niż nieprawidłowe. Tradycyjne sondy okazywały się dokładne tylko z powodu tzw. przecieku tożsamości pytania, który znika w ocenie pogrupowanej. Decodability osiąga korelację Pearsona r=0,75 w przewidywaniu zysku dokładności selekcji nad głosowaniem na danych testowych, z progiem decyzji przy AUC=0,60.

Na wielu modelach LLM ogólnego przeznaczenia i specjalistycznych modelach medycznych CASE pokonuje zwykłe głosowanie o nawet 19 punktów procentowych na pytaniach średniej trudności i 16,8 punktów na pytaniach trudnych. Wyniki sugerują że decodability zależy od wyrównanej wiedzy którą posiada model, otwierając nowe perspektywy dla ulepszania procesów selekcji odpowiedzi w rzeczywistych aplikacjach.