Paige i Microsoft stworzyły PRISM2 - model łączący interpretację całych slajdów patologicznych z dialogiem klinicznym pochodzącym z raportów medycznych. Model wykorzystuje perceiver-based encoder, który agreguje osadzenia z tysięcy kafelków tkanki w jedną reprezentację slajdu, a następnie generuje tekstowe odpowiedzi na pytania diagnostyczne zamiast tradycyjnej klasyfikacji pikseli.

Architektura pracy modelu dzieli się na dwa etapy. W pierwszym fazie trenuje się encoder slajdów - uczy się on agregować cechy poziomu kafelka Virchow2 w wektorową reprezentację slajdu skorelowaną z językiem raportu. W drugiej fazie encoder zostaje zamrożony, a cała praca przenosi się na model językowy, który fine-tuningiem uczy się konwencji raportowania patologicznego. Training wykorzystuje 2,3 miliona całych slajdów patologicznych oraz 685 507 raportów z Memorial Sloan Kettering Cancer Center, przekonwertowanych przez GPT-4o w pary pytanie-odpowiedź.

Ten hybrydowy podход łączący percepcję wizualną z rozumowaniem poprzez naturalne języki otwiera nowe możliwości dla wspomagania diagnostyki patologicznej. Zamiast uczyć się klasyfikować piksele, PRISM2 uczy się odpowiadać na rzeczywiste pytania diagnostyczne. Obecna implementacja wspiera jednoosiowy dialog - dalszą inżynierią byłoby umożliwienie wieloobrotowych konwersacji, ale nawet w tej formie model reprezentuje znaczący krok w kierunku bardziej intuicyjnych i interpretowanych systemów diagnostycznych.