Naukowcy z arXiv przeprowadzili kompleksową ocenę pięciu dużych modeli językowych pod kątem ich przydatności w automatycznym handlu i analizie technicznej rynków finansowych. Testy obejmowały GPT-4 Turbo, Claude 3 Opus, Gemini 1.5 Pro, Llama 3 70B oraz FinGPT - model specjalizowany dla zadań finansowych. Eksperymentalne ramy badawcze obejmowały cztery strukturalne zadania: rozpoznawanie formacji świecowych na danych OHLCV (open, high, low, close, volume), generowanie sygnałów kierunkowych BUY/SELL/HOLD, backtesting jakości sygnałów poprzez symulowaną produkcję oraz zrozumienie raportów finansowych.

Wyniki symulowanych backtest-ów pokazały, że GPT-4 Turbo osiągnął najwyższy roczny zwrot i współczynnik Sharpe'a wśród modeli uniwersalnych, podczas gdy FinGPT wykazał konkurencyjne wyniki dostosowane do ryzyka dzięki fine-tuningowi dla domeny finansowej. Oba modele pobiły pasywny benchmark S&P 500 w testowanych warunkach, kiedy oceniano je przy użyciu ścisłych metrycznych kryteriów takich jak maximum drawdown, Sortino ratio czy information coefficient. To sugeruje, że LLM-y mogą rzeczywiście znaleźć zastosowanie w systemach handlu opartych na AI.

Jednak badanie ujawniło istotne ograniczenia wszystkich ocenianych modeli. Naukowcy zaidentyfikowali trwałe sposoby awarii, w tym halucynacje numeryczne (wymyślanie cyfr), ograniczenia okna kontekstu uniemożliwiające przetwarzanie dużych ilości historycznych danych oraz niespójną wydajność w warunkach trendów bocznych. Badacze konkludują, że choć LLM-y mają prawdziwy potencjał w systemach handlu AI, bezpieczne wdrażanie wymaga ostrożnej dekompozycji zadań i świadomości wrodonych ograniczeń tych modeli.