PRO-Step to nowa metoda trenowania modeli RAG, która rozwiązuje fundamentalny problem w systemach łączących wyszukiwanie z generowaniem - błędy w wyszukiwaniu na wczesnych etapach często uniemożliwiają poprawne rozumowanie w kolejnych krokach. Tradycyjne podejścia nagradzały tylko ostateczną odpowiedź, co oznaczało, że pośrednie błędy pozostawały niezauważone, a czasem przypadkowe trafienia maskowały błędne rozumowanie.
Nowa metoda trenuje generatywny process reward model (PRM) do oceny każdego kroku rozumowania na dwóch wymiarach - logicznej poprawności i faktycznego ugruntowania w pobranych źródłach. Wykorzystując przeszukiwanie drzewa wartości kierowanego przez PRM, system tworzy pary preferencji kontrastujące poprawne kroki z błędnymi, a następnie optymalizuje politykę poprzez Direct Preference Optimization na poziomie kroków. Podejście to radykalnie zmienia perspektywę - zamiast oceniać krok względem końcowego wyniku, system ocenia go samodzielnie.
Eksperymenty wykazały, że PRO-Step osiąga najlepsze średnie wyniki w metrykach EM i F1 na pięciu benchmarkach, включając zarówno proste jak i złożone zadania wymagające wieloetapowego rozumowania. Autorzy udostępnili kod, modele i dane treningowe publicznie, co pozwala społeczności eksperymentować z metodą i budować na niej.