Naukowcy zaprezentowali Backtrader-Bench, framework stworzony aby ewaluować zdolności agentów LLM w kodowaniu dla handlu algorytmicznego. Problem polega na tym, że standardowe benchmarki statyczne grożą kontaminacją danych treningowych, a walidacja wyników backtestów wymaga porównania z rzeczywistym kodem. System rozwiązuje to poprzez dwa uzupełniające się podejścia: determinisityczny pipeline generujący pytania wielokrotnego wyboru z konfiguracji handlowych, oraz autonomiczny mining trudniejszych pytań weryfikowanych poprzez wykonywalne fragmenty kodu.
Pierwszy pipeline objął pięć strategii tradingowych, 33 szablony pytań i trzy poziomy trudności, z niezależnym checkerem który ponownie wyprowadza każdą odpowiedź. Drugi pipeline to generator-solver filtrujący: generator tworzy pytania zweryfikowane kodem, konwertuje je do MCQ i odrzuca te, które solver bez dostępu do narzędzi może rozwiązać bez faktycznego wykonania kodu. Taki filtr wymusza aby pytania wymagały rzeczywistego kodowania, a nie tylko guessowania.
Wyniki testów 11 modeli bez narzędzi oraz czterech konfiguracji z narzędziami pokazały wyraźną przewagę tool-augmented podejścia. Na 30-pytaniowym zbiorze kuratowanym modele GPT-4.5 i Opus 4.7 z dostępem do narzędzi osiągnęły 90 procent dokładności, podczas gdy najlepsze baseline'y bez narzędzi uzyskały średnio 73 procent przez dziesięć przebiegów - różnica 17 punktów procentowych. Na osobno wydobytych 38 pytaniach dokładność no-tools spadła drastycznie, przy czym połowa modeli osiągnęła poziom prawie losowego zgadywania około 25 procent. Framework jest zaprojektowany aby generować dane treningowe dla reinforcement learning i ostatecznie budować specjalizowane agenty dla workflows quantitative tradingu.