Naukowcy wprowadzili Prospective Hypothesis Discovery (PHD) - nową zdolność oceny dla dużych modeli językowych polegającą na autonomicznym konstruowaniu uzasadnionych, rozróżniających i testowalnych przestrzeni hipotez na podstawie niepełnych dowodów, takich jak anomalne obserwacje czy fragmentaryczne zapisy. To odróżnia się od tradycyjnych benchmarków, gdzie modele odpowiadają na wcześniej określone pytania.

Aby zmierzyć tę zdolność, zespół stworzył HypoArena - benchmark składający się z HypoData (988 przypadków badawczych z sześciu dziedzin: od nauk przyrodniczych po analizę danych) i HypoEval (ramy do oceny otwartych zbiorów hipotez). Kluczową innowacją jest Retrospective Context Regression - potok Forge-Audit, który rekonstruuje przedwnioskowe konteksty z ukończonych dokumentów eksperckich poprzez usunięcie jawnych wniosków i retrospektywnych przyczyn, zachowując faktyczną podstawę.

Eksperymenty na 15 najnowszych LLM ujawniły wyraźną stratyfikację zdolności - niektóre słabsze modele wykazały znaczną poprawę na HypoArena, podczas gdy inne systemy, w tym czołowe modele, wykazały regresję. Ta asymetryczna odpowiedź sugeruje, że umiejętności analityczne wymagane do spekulacyjnego odkrywania hipotez na etapie wstępnym badań są fundamentalnie różne od tych potrzebnych do odpowiadania na ustrukturyzowane pytania. Badanie otwiera nowe perspektywy dla oceny potencjału LLM w rzeczywistej pracy badawczej i analizie naukowej.