Naukowcy opracowali BatchDAG, system który pozwala modelom językowym planować złożone analizy danych poprzez generowanie typizowanych grafów acyklicznych (DAG) zawierających operacje takie jak zapytania SQL, wyszukiwania semantyczne i transformacje danych. System automatycznie wykonuje te grafy z równoleglością falową, unikając problemów, które tradycyjnie trapiły LLM-y przy analizach dużych zbiorów danych - przepełnienia kontekstu, utraty przypisania danych do konkretnych jednostek i liniowych opóźnień z sekwencyjnych wywołań narzędzi.

Kluczową optymalizacją jest batching świadomy jednostek logicznych (entity-aware batching), który grupuje wiersze danych przed operacjami rozpłoduowania, redukując wywołania modelu o do 47 razy. W testach na 12 zapytaniach zawierających transkrypty BatchDAG uzyskał ocenę 3,74 na 5, porównywalną z ręcznie zaprojektowanym potokiem pracy (3,25 na 5) i znacznie lepszą niż agent ReAct (3,09 na 5, p mniejsze niż 0,01). Szczególnie istotne jest to, że system osiągnął lepszą możliwość śledzenia źródeł - 77 procent dowodów pochodzi bezpośrednio z transkryptów wobec 46-60 procent dla metod bazowych, co wskazuje na zmniejszone halucynacje.

BatchDAG nie jest przede wszystkim poprawą dokładności wobec istniejących rozwiązań, lecz uniwersalnym systemem orkiestracji, który zastępuje wiele ręcznie inżyniowanych potoków pracy jednym systemem generującym strategię wykonania z naturalnego języka. Ablacyjne testy pokazały, że strukturyzowane pośrednie dane w formacie JSON zmniejszają halucynacje o 27 procent w porównaniu do podsumowań tekstowych, a planista osiąga 98,8 procent wskaźnik generowania poprawnych grafów.