MedProb to nowa lekka metoda probing, która rozwiązuje pytania medyczne o obrazach poprzez odczytanie informacji z zamrożonych reprezentacji modeli wizyjno-językowych, zamiast generować odpowiedzi tekstowe. Badacze wykazali, że takie podejście odzyskuje więcej sygnału istotnego dla odpowiedzi niż tradycyjny prompt engineering i osiąga lepsze wyniki niż dedykowane medyczne VLM-y oraz systemy agentic.

Kluczowym odkryciem jest to, że mniejsze modele zawierają więcej informacji do odtworzenia dotyczącej odpowiedzi na pytania Med-VQA niż ujawniają to metody generacyjne. Gdy porównano 14 par modeli ogólnego przeznaczenia i medycznych, okazało się że specjalistyczne dostosowanie medyczne nie konsekwentnie poprawia liniową dekodalność reprezentacji. To sugeruje, że architektura i pretrenowanie mogą być ważniejsze niż fine-tuning medyczny dla tego rodzaju zadań.

Badania ujawniły też, że wolnotekstowa generacja wykazuje znaczące odchylenie pozycyjne aż do 10 punktów procentowych, gdzie model faworyzuje odpowiedzi umieszczone na konkretnych pozycjach. MedProb również ma tego rodzaju odchylenie, ale jest ono zdeterminowane inaczej niż w promptingu, co może stanowić przewagę podczas ewaluacji. Metoda została sprawdzona na zestawach PATH-VQA, SLAKE i VQA-RAD, z możliwością rozszerzenia na zadania otwarto-koncowe poprzez procedurę scoring z rejection sampling.