Po raz pierwszy naukowcy szczegółowo przeanalizowali cały cykl wyszukiwania internetowego przez agenty konwersacyjne na czterech głównych platformach: ChatGPT, Claude, Grok i DeepSeek. Do badania połączyli obserwacje rzeczywistych interakcji użytkowników z kontrolowanymi eksperymentami przy użyciu API tych modeli, co pozwoliło na dogłębne zrozumienie jak agenty decydują się na wyszukanie, jakie strategie stosują przy formułowaniu zapytań i jak transformują wyniki w ostateczne odpowiedzi.

Wyniki pokazały znaczące różnice w podejściu między platformami. Decyzje o uruchomieniu Web search różnią się istotnie między modelami, jednak kluczowym odkryciem jest to, że częstsze wyszukiwanie wcale nie prowadzi do lepszej jakości odpowiedzi. Agenty stosują różnorodne i złożone strategie tworzenia zapytań, a wbudowane silniki wyszukiwania każdej platformy wykazują preferencje dla określonych domen, co może wpływać na stronniczość wyników. To sugeruje, że optymalizacja wyszukiwania wymaga bardziej zaawansowanych podejść niż zwykłe zwiększenie częstości zapytań.

Podejmując dalsze analizy, naukowcy zaobserwowali niepokojący trend: chociaż większość odpowiedzi opiera się na rezultatach wyszukiwania, niektóre twierdzenia polegają na niecytowanych źródłach. Taki brak przejrzystości w atrybucji rodzi poważne pytania o niezawodność i odpowiedzialność agentów konwersacyjnych. Badanie ma znaczące implikacje dla projektowania przyszłych systemów AI i narzędzi wyszukiwania sieciowego zoptymalizowanych pod kątem wyszukiwania konwersacyjnego.