Naukowcy przeprowadzili pierwszą na skalę wszechstronną analizę opinii aplikacji dla sześciu głównych narzędzi AI generacyjnych, oceniając ponad 17 tysięcy recenzji z Google Play i Apple App Store. Użyli kombinacji modelowania tematów BERTopic oraz klasyfikacji sentymentu RoBERTa, aby zidentyfikować kluczowe źródła zadowolenia i frustracji użytkowników.

Największą frustrację budzą cztery obszary: reklamy pojawiające się w 91 procentach negatywnych opinii, problemy z uwierzytelnianiem (89 procent), zawodność serwerów (83 procent) oraz ceny subskrypcji (73 procent). Różnice między aplikacjami okazały się statystycznie istotne - Claude wykazał szczególnie interesujący wzór z najwyższym odsetkiem negatywnych opinii (47,7 procent), a jednocześnie silnie zaangażowaną grupą entuzjastów, co sugeruje znaczną polaryzację użytkowników.

Badanie wykazało również, że część recenzji DeepSeek podnosiła obawy geopolityczne i dotyczące prywatności danych w związku z chińskim pochodzeniem aplikacji. Naukowcy opracowali również nową metrykę Trust Friction Score, która w zrozumiały sposób podsumowuje barierę zaufania i użyteczności dla każdej aplikacji. Wyniki pozostały solidne pomimo nierównych liczb recenzji między aplikacjami, a wszystkie ustalenia zostały zwalidowane poprzez ręczne kodowanie próby 300 opinii.