Zespół badawczy zaprezentował Search-on-Graph-R1, kompaktny model 8B parametrów, który internalizuje nawigację po grafach wiedzy zamiast polegać na kosztownych wywołaniach dużych modeli granicznych. Głównym pomysłem jest wspieranie nauczyciela-modelu granicznego za pomocą złotych zapytań SPARQL dla każdego pytania, dzięki czemu nauczyciel przechodzi znaną ścieżkę zawierającą odpowiedź z użyciem żywego narzędzia Search, zamiast musiał odkrywać tę ścieżkę samodzielnie.

Trajektorie treningowe powstają przez rzeczywiste wykonanie każdego zapytania na żywym serwerze Freebase, co gwarantuje, że są ugruntowane w grafie wiedzy już z konstrukcji. Model trenuje się poprzez supervised fine-tuning, które ustala podstawowe umiejętności nawigacji, a następnie reinforcement learning, który pozwala modelowi uczyć się osiągania odpowiedzi przy mniejszej liczbie wywołań narzędzia Search niż podczas fazy SFT.

Wyniki na benchmarkach WebQSP, CWQ i GrailQA pokazują, że Search-on-Graph-R1 przewyższa wszystkie porównywane systemy wykorzystujące zamrożone modele graniczne. Szczególnie imponujące są osiągnięcia na CWQ, gdzie model uzyskał najlepsze rezultaty spośród wszystkich porównywanych systemów. Istotne jest, że podczas wnioskowania nie wymaga żadnych dodatkowych modułów pomocniczych ani sędziego LLM podczas treningu, co czyni go bardziej efektywnym zarówno w sensie obliczeniowym jak i praktycznym.