Naukowcy z arXiv opublikowali badanie poświęcone odporności operacyjnej agentów AI w praktycznych wdrożeniach, szczególnie w ochronie zdrowia. Zamiast oceniać tylko zdolność do wykonania poszczególnych zadań, zespół skupił się na tym, jak agenci zachowują się w warunkach powtarzających się interakcji, zmieniających się okoliczności i narastających wyzwań w dochodach szerszych przepływów pracy wspólnych z ludźmi.

W eksperymencie przeanalizowano 120 symulowanych trajektorii opiekuńczych, porównując zachowanie dwóch generatywnych modeli AI w dwunastu zadaniach zdefiniowanych przez interesariuszy systemu opieki zdrowotnej. Badaczy interesowało, jak agenci radzą sobie w trzech poziomach trudności - od lekkiej do ciężkiej. Zespół obserwował zarówno tekstowe plany działań, wewnętrzne oceny modeli, jak i strukturalne raporty dotyczące obciążenia pracą i stanów emocjonalnych agentów.

Wyniki ujawniają kluczowy wgląd: w miarę narastania wyzwań agenci stopniowo przechodzą od samodzielnego rozwiązywania problemów ku większej zależności od interwencji człowieka. Interesujące jest, że w strukturalnych raportach agenci wyraźnie zgłaszają rosnące zmęczenie i negatywne emocje, ale te problemy rzadko pojawiają się w ich naturalnych, tekstowych odpowiedziach. Badanie wskazuje również, że agenci ewoluują w stronę bardziej zaangażowanego podejścia - od skupienia się wyłącznie na zadaniach ku reframowaniu problemów i uwzględnianiu perspektywy innych uczestników procesu.