Zespół badaczy rozwiązał problem inteligentnego kierowania zapytań do specjalistycznych agentów wyszukiwania poprzez wytrenowanie małego modelu języka na kombinacji supervised fine-tuning i reinforcement learning. Tradycyjne podejścia kierują zapytania na podstawie wnioskowanego tematu, co nie wyłapuje sytuacji, gdy tematycznie pasujący agent zwraca słabe wyniki. Nowa metoda tego unika, uczeń się od rzeczywistych rezultatów.

Model uczy się, które agenty niezawodnie zwracają wysokiej jakości rezultaty dla jakich typów zapytań, a kiedy powinien przekierować zapytanie poza specjalistę pomimo powierzchniowego dopasowania tematycznego. Wykorzystano hierarchiczną funkcję nagrody łączącą trafność wyszukanego materiału z dopasowaniem tematu między zapytaniem a agentem. Na zbiorze zapytań, gdzie tradycyjne routowanie zawodzi, nowy model osiągnął NDCG@10 0.918 w porównaniu z 0.539 dla Amazon Nova Lite i 0.490 dla Claude Haiku 4.5.

Pracą jest znacząca - sprawia, że mały model staje się lepszy niż duże modele fundacyjne w konkretnym zadaniu. Dodatkowo średnie opóźnienie wyniosło zaledwie 120.1 ms, czyli 82.4 procenta szybciej niż Nova Lite. To pokazuje, że specjalizowane małe modele trenowane na właściwych sygnałach mogą być zarówno bardziej dokładne, jak i wydajniejsze od dużych modeli do ogólnych celów.