Naukowcy zgłaszają krytyczną uwagę dotyczącą porównania zdolności generowania pomysłów badawczych między modelami językowymi a ludźmi. Problém tkwi w asymetrii danych: ludzka linia bazowa pochodzi z opublikowanych artykułów naukowych, natomiast pomysły LLM to propozycje wygenerowane w jednym podejściu, bez filtrowania przez proces publikacji.

To wywołuje efekt przeżycia - publikowanie selektywnie faworyzuje pewne typy pomysłów. Jeśli pomysły syntetyzujące lub łączące istniejące koncepcje są łatwe dla modeli do wygenerowania, ale rzadko przechodzą proces recenzji i publikacji u ludzi, to opublikowane prace naukowe będą niedoreprezentować tę kategorię. W rezultacie obserwowana różnica między wydolnością LLM a ludzi może być częściowo (lub całkowicie) artefaktem metodologicznym, a nie rzeczywistą różnicą w możliwościach.

Zauważenie tego problemu jest ważne dla wiarygodności badań porównawczych LLM-ów, szczególnie w kontekście oceny ich zdolności do innowacyjnego myślenia badawczego. Aby uniknąć tego błędu, porównanie powinno albo uwzględnić opublikowane artykuły wygenerowane przez LLM-y, albo porównywać pomysły ludzi w tym samym nieselekcjonowanym formacie.