Search-G1 to nowy framework do szkolenia agentów językowych, który rozwiązuje fundamentalny problem: modele mają tendencję do wyszukiwania informacji zewnętrznych zbyt często lub niewystarczająco, a czasami zwracają odpowiedzi, które nie są naprawdę oparte na pobranym materiale. Tradycyjne podejścia mają ograniczenia - nagrody z obserwacji tylko wyniku nie potrafią odróżnić rzeczywistego ugruntowania w dowodach od zbędnego wyszukiwania, a bogatsze sygnały zwrotne wymagają kosztownych adnotacji lub oceny przez modele LLM podczas treningu.

Proponowana metoda wykorzystuje dwa sprytne mechanizmy opartych na reprezentacjach. Pierwszy, readout stanu promptu, przewiduje czy model potrafi odpowiedzieć na pytanie ze swojej wiedzy - jeśli tak, agent nie powinien wyszukiwać. Drugi, readout zatwierdzenia odpowiedzi, mierzy wrażliwość odpowiedzi na usunięcie pobranego materiału - jeśli odpowiedź się zmienia, oznacza to że rzeczywiście opiera się na dowodach. Razem te dwa sygnały decydują, kiedy wyszukiwanie było rzeczywiście potrzebne i czy odpowiedź była gruntowna.

Znaczenie tego podejścia polega na efektywności treningu. W przeciwieństwie do poprzednich metod, Search-G1 nie wymaga adnotacji procesu czy oceny przez modele LLM podczas optymalizacji polityki agenta - wystarczy analiza reprezentacji wewnętrznych. To otwiera możliwość szkolenia lepszych agentów wyszukiwaczy na dużą skalę bez nadmiernych kosztów obliczeniowych, co może mieć wpływ na praktyczne zastosowania systemów RAG w profesjonalnych aplikacjach.