Zespół badawczy opracował praktyczną metodę oceny systemów AI pomagających w pierwszym zeznaniu pacjentów w psychiatrii. Platforma InterviewPlayground wykorzystuje symulowanego pacjenta wyposażonego w pamięć do prowadzenia rozmów z algorytmami AI w otwarty, naturalny sposób - podobnie jak rzeczywista rozmowa kliniczna. To pozwala szpitalom rutynowo testować narzędzia AI przed wprowadzeniem ich w praktykę, bez konieczności zatrudniania dodatkowych specjalistów do każdej oceny.
W eksperymencie porównującym system bazujący na GPT z pracą sześciu doświadczonych psychiatrów pojawiły się interesujące wyniki. Model AI okazał się lepszy w wydobywaniu faktycznych informacji z rozmowy - odzyskał 88 procent klinicznych szczegółów ukrytych w scenariuszach pacjentów, podczas gdy ludzie zdobyli tylko 39 procent. Jednakże AI miało znaczące słabości: w 57 procentach przypadków robił kliniczne wnioski bez faktycznego poparcia w wywiadu (u psychiatrów był to wynik 28 procent), a najgorsze było to, że zaidentyfikował tylko jedną trzecią ostrzeżeń bezpieczeństwa wobec dwóm trzecim u specjalistów.
Badanie ma duże znaczenie dla zdrowotnictwa, bo pokazuje że choć AI może przesiewać rutynowe dane pacjentów szybciej i wyczerpującej niż ludzie, jego halucynacje i brak uwagi na zagadnienia bezpieczeństwa są poważnym problemem klinicznym. Platforma InterviewPlayground staje się tu kluczowym narzędziem do sformalizowania takich testów - szpitale mogą teraz mierzyć, jak konkretny system radzić sobie z ich standardami zanim pacjenci go zobaczą.