Naukowcy stworzyli BI-Bench - pierwszy benchmark do testowania zdolności dużych modeli językowych w automatyzacji całych procesów business intelligence, oraz opracowali BI-Agent, agenta AI zdolnego do wykonywania złożonych zadań analitycznych. Tradycyjnie, pracy w narzędziach BI takich jak Power BI czy Tableau poprzedza czasochłonna faza przygotowania: trzeba znaleźć odpowiednie tabele w bazie danych, przekształcić dane i zbudować relacje, dopiero potem odpowiadać na pytania biznesowe.
Badacze zebrali zbiór pytań i odpowiedzi z rzeczywistych projektów BI dostępnych publicznie, tworząc benchmark obejmujący problemy świata rzeczywistego. Okazało się, że nawet najwyżej oceniane modele LLM osiągają na BI-Bench mniej niż 50 procent dokładności. Słaba wydajność wynika z trudności w łączeniu umiejętności językowych z precyzyjnym manipulowaniem strukturalnymi danymi - model musi nie tylko zrozumieć pytanie biznesowe, ale też sprawnie nawigować po schemacie bazy danych.
Odpowiedzią jest BI-Agent, system który rozkłada zadania na specjalistyczne podproblemy: wyszukiwanie odpowiednich tabel, łączenie danych (join), transformacje i ostateczna analiza. Agent wykorzystuje wyspecjalizowane metody zarządzania danymi na każdym etapie przepływu pracy. Naukowcy opracowali też framework post-training syntetyzujący rzeczywiste trajektorie z projektów BI, co pozwala systemowi się uczyć z faktycznych scenariuszy pracy analityków.