Zespół badaczy wprowadził OpenDiscoveryTrace, nowy publiczny zbiór danych zawierający 558 pełnych trajektorii pracy naukowców AI. Zamiast oceniać tylko ostateczne rezultaty - wygenerowany kod, hipotezy czy artykuły - dataset rejestruje każdy krok procesu myślenia modeli, od formułowania pytań po obserwacje błędów i korekty.
Każda trajektoria zawiera strukturyzowane dane z 9 polami na każdy krok, włączając myśli, wywołania narzędzi, obserwacje, błędy, przyczyny zmian i samoocenę pewności. Badacze testowali siedem modeli: trzy frontier (GPT-5.4, Claude Opus 4.6 i Gemini 3.1 Pro po 124 trajektorii każdy) oraz cztery modele open-weight (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B po 30 trajektorii każdy). Zadania obejmowały discovery leków, naukę o materiałach, genomikę i analizę literatury naukowej.
Wstępna analiza 363 trajektorii ocenionych przez LLM-y ujawniła zaskakujące różnice między modelami. Choć wszystkie trzy modele frontier uzyskały porównywalne wskaźniki sukcesu na poziomie 84-89%, Claude Opus 4.6 wytwarzał średnio 2.5 błędu na trajektorię, podczas gdy GPT-5.4 zaledwie 0.08 - różnica 30-krotna statystycznie istotna. To pokazuje, że tradycyjne benchmarki skupiające się wyłącznie na wynikach końcowych mogą maskować fundamentalne różnice w niezawodności i metodologii poszczególnych modeli. OpenDiscoveryTrace umożliwia audyt naukowy, diagnostykę przyczyn porażek i rozróżnienie między faktycznym rozumowaniem a szczęśliwym zgadnięciem.