Naukowcy z zespołu zajmującego się interpretowalnością modeli AI odkryli, że model Gemma-3-27B-PT przechowuje czytelne reprezentacje objawów depresji w swoich wewnętrznych aktywacjach neuronowych. Wykorzystując techniki mechanistycznej interpretowości, analizowali residual stream modelu i znaleźli, że objawy depresji są najwyraźniej oddzielone geometrycznie w warstwie 21 sieci. Gdy zespół projektował naturalne teksty pacjentów na wektory objawów zbudowane z klinicznych instrumentów diagnostycznych, uzyskane współczynniki zachowywały rangowanie klinicznych adnotacji dla trzech kluczowych wymiarów: nastroju, objawów somatycznych i suicydalności.

Ta praca jest ważna, ponieważ współczesna praktyka kliniczna zwykle redukuje zróżnicowane profile objawów depresji do pojedynczego wyniku nasilenia. Modele języka mają potencjał do captury więcej szczegółów, ale dotychczas pozostawało niejasne, jak wewnętrznie reprezentują te złożone stany psychiczne. Naukowcy wykazali, że pojedynczy wektor depresji w warstwie 21 może rozróżniać tekst pacjentów z depresją od zdrowych z dokładnością 0,789 (AUC), działając jako bramka walidująca, która ogranicza analizę symptomów tylko do mowy wskazującej na depresję.

Wyniki otwierają drogę do bardziej interpretowańnych narzędzi diagnostycznych opartych na AI, które mogą lepiej odzwierciedlać clinicianskie osądy i budować większe zaufanie do sztucznej inteligencji w psychiatrii. Zamiast czarnej skrzynki, możliwe będzie zrozumienie, które dokładnie objawy model wykrywa i jak ocenia ich nasilenie.