Naukowcy z arXiv przedstawili FinSkillBench - metodę do testowania zdolności agentów AI do pracy z finansowymi danymi i procedurami. W przeciwieństwie do ogólnych benchmarków, FinSkillBench sprawdza, czy modele mogą rzeczywiście pracować z rzeczywistymi danymi finansowymi typu point-in-time, budować prawidłowe struktury danych wejściowych i generować audytowalne wyniki. Benchmark zawiera 2603 epizody zadań podzielone na trzy domeny: konstruowanie portfeli inwestycyjnych, zarządzanie ryzykiem oraz analiza fundamentalna akcji.

Wyniki eksperymentów na 9 modelach pokazały wyraźny wzorzec. Gdy agentom AI udostępniono gotowe pakiety umiejętności zawierające procedury i komponenty wykonawcze, średnia wydajność wzrosła z 0,366 do 0,528. Największe zyski zaobserwowano w obszarach konstruowania portfeli i zarządzania ryzykiem. Z kolei procedury pisane przez samych agentów nie przynosiły znaczących korzyści pomimo wyższych kosztów obliczeniowych.

Wniosek z badań ma praktyczne znaczenie dla branży fintech i zarządzania aktywami. Sugeruje, że bardziej efektywne będzie przygotowanie specjalistycznych procedur i narzędzi dla AI zamiast oczekiwania, że agenty same wymyślą potrzebne sobie metody. Niezależna weryfikacja przy użyciu innej platformy agentów (Hermes Agent) na 8 modelach potwierdziła te wzorce, choć skala efektów różniła się zależnie od konkretnego podania.