Zespół naukowców opracował CIFQA, framework łączący wieloagentowe systemy LLM z deterministycznymi narzędziami do obsługi złożonych pytań finansowych wymagających dokładnych obliczeń. Problem, który rozwiązywali, jest dobrze znany: duże modele językowe potrafią doskonale rozumieć język naturalny, ale często zwracają numerycznie niepoprawne odpowiedzi, które brzmią wiarygodnie - szczególnie w przypadku wieloetapowych obliczeń finansowych.
Architektura CIFQA opiera się na podziale zadań pomiędzy wyspecjalizowane agenty: jeden zajmuje się interpretacją pytania, drugi routingiem, trzeci ekstrakcją parametrów, czwarty planowaniem obliczeń, a piąty generowaniem odpowiedzi. Najważniejsze jednak, że faktyczne kalkulacje finansowe i aplikacja reguł biznesowych odbywają się za pomocą deterministycznego kodu Python, a nie poprzez predykcje modelu. System zvalidowano na pytaniach dotyczących stałych depozytów, osiągając 95,54% dokładności na pytaniach wymagających obliczeń i 90,87% dokładności całkowitej - znacznie wyżej niż baseline'owe LLM-y, nawet gdy te otrzymały pełne wzory, tabele stawek i szczegółowe instrukcje.
Badania ablacyjne pokazały, że komponenty deterministyczne są krytyczne dla sukcesu: precyzyjne wyszukiwanie stawek, obliczanie okresu, korekty roczne i logika przedwczesnego wycofania. Szczególnie ważny wniosek: nawet 17-miliardowy model open-source działający w ramach CIFQA osiągał lepsze wyniki niż znacznie większe modele zamkniętego źródła pracujące w tradycyjnym trybie. To otwiera perspektywę dla organizacji, które mogą wdrażać takie hybrydowe systemy z mniejszymi modelami zamiast polegać na tych największych.