Badacze z arXiv opracowali metodę do identyfikacji, kiedy agenty prognozujące powinny polegać na rozumowaniu modelu języka, a kiedy na alternatywnych podejściach. Zamiast traktować wybór źródła jako ukryty szczegół implementacji, potraktowali go jako obserwowalną decyzję agenta i testowali na zadaniach binarnego prognozowania z bazy ForecastBench.
Kluczowe odkrycie pokazuje, że najlepszy mechanizm zależy od źródła danych. Dla niektórych procesów generujących dane strukturalne analogi historyczne dominowały, podczas gdy dla innych lepsze były przesłanki rynkowe lub konserwatywnsze podejścia. Zespół zaproponował ReliabilityRoute - metodę kierowania zachowaniem agenta przy użyciu cech niezawodności takich jak historyczne pokrycie, dostępność przesłanek rynkowych, ostrość przesłanek źródłowych, siła dowodów i ich rozbieżności. System testowali na 16 kolejnych wersjach modelów LLM z okresu 2024 roku.
Wyniki pokazują, że więcej rozumowania niekoniecznie prowadzi do lepszych prognoz - agenty powinny najpierw ocenić, które źródło informacji zasługuje na kontrolę. Chociaż zyski są skromne i tradycyjne linie bazowe pozostają konkurencyjne, badanie stanowi ważny test niezawodności pokazujący znaczenie strategicznego routingu zachowań agenta zamiast bezrefleksyjnego zwiększania złożoności rozumowania.