Naukowcy z arXiv opublikowali SchemaRouter - nową warstwę routingu optymalizującą wydajność heterogenicznych systemów agentic RAG, które orchestrują wiele źródeł danych: API, bazy danych, vector stores i grafy wiedzy. Problem polega na tym, że tradycyjne podejścia albo wystawiają agentowi wszystkie opisy narzędzi naraz (powodując over-fetching - zbędnie duże ładunki i wysoką liczbę tokenów), albo wybierają narzędzia wyłącznie przez similitude wektorową (co prowadzi do under-fetchingu - brakujących pól potrzebnych do odpowiedzi).
SchemaRouter reprezentuje narzędzia, endpointy, parametry, pola odpowiedzi, koncepcje domenowe, jednostki, proweniencję i polityki licencyjne jako graf schematów. Mały LLM ekstraktuje intencję i koncepcje zapytania, zaś wybór pól następuje deterministycznie na grafie poprzez projekcję grup intencji i dopasowanie koncepcji-pola z warstwą aliasów. To podejście unika drożyzny tradycyjnych metod - zamiast wysyłać wszystkie możliwe dane lub zgadywać przez podobieństwo, precyzyjnie wybiera dokładnie to, co jest potrzebne.
Na benchmarku materials-science z 110 zapytaniami SchemaRouter osiągnął dokładność odpowiedzi 0.71 (równoważnie z pobieraniem wszystkiego), przy wykorzystaniu zaledwie 227 tokenów kontekstu wobec 2066 dla fetch-everything - to prawie 10 razy mniej. Całkowita latencja end-to-end była 2.7 razy niższa od prompt-all. System uzyskał także najlepszy wynik w kategoriach: dokładność narzędzia 0.93 i prawidłowość parametrów 1.0. Dodatkowo poprawnie ugruntował informacje o proweniencji i licencji w 62 procentach odpowiedzi, co jest kluczowe dla odpowiedzialności systemów.