Naukowcy z arXiv opracowali nowy executable benchmark i algorytm meta-routingu do optymalizacji decyzji w systemach agentowych. Zamiast wybierać pojedyncze komponentu - endpoint modelu, głębokość wyszukiwania czy narzędzie - nowe podejście komponuje heterogeniczne operacje bezpośrednio z surowego tekstu zadania. System musi decydować, czy odpowiedzieć natychmiast, rozłożyć żądanie na podzadania, wyszukać dowody, wykonać kod czy delegować do specjalisty.

Benchmark zawiera 496 zadań podzielonych na grupy treningową (216), rozwojową (72), testową (108) i challenge z leksykalnym przesunięciem (108). Obejmuje analizę danych, badania w zamkniętych korpusach i przetwarzanie dokumentów. Wyniki są automatycznie sprawdzane po wykonaniu operacji. Algorytm wykorzystuje niezależne regularyzowane głowy logistyczne do przewidywania prawdopodobieństw operacji na podstawie cech słownych i znakowych, następnie komponuje je greedy'ego pod budżety kosztów i liczby akcji.

Na testach held-out polityka uczona osiągnęła 100% sukcesu wobec 93,5% dla statycznych workflow'ów, przy 43% niższych kosztach. Na untouched challenge split rezultaty spadły do 75,9% sukcesu, poniżej statycznego routingu (93,5%), ale pozostały 49% tańsze. Badacze stwierdzili, że głównym ograniczeniem jest generalizacja leksykalna, a nie wykonanie samych tras - to wskazuje kierunek przyszłych ulepszeń dla bardziej robuustnych systemów agentowych.