Badacze opracowali SLPO, metodę która łączy reinforcement learning z wiadomościami weryfikowalnymi w modelach wykorzystujących ukryte rozumowanie zamiast jawnych Chain-of-Thought. Główną motywacją jest przezwyciężenie problemu obliczeniowego - w tradycyjnym podejściu każdy krok pośredni musi być zdekodowany jako token języka, co jest drogie computacyjnie.
Latentne rozumowanie ma już inherentną przewagę: przenosi obliczenia pośrednie jako wektory ciągłe i osiąga podobne lub lepsze wyniki niż jawne CoT na znacznie krótszych horyzontach. Problem polega na tym, że modele z ukrytym rozumowaniem pozostały w dużej mierze ograniczone imitacją, podczas gdy jawne Chain-of-Thought już wdrożyło outcome-reward RL. Latentne trajektorie nie mają łatwo obliczalnego prawdopodobieństwa na każdy krok oraz nie posiadają interfejsu adaptacyjnego zatrzymania w ramach ustalonego budżetu myślenia, co uniemożliwia elicytację test-time scaling.
SLPO wprowadza dwie kluczowe innowacje: empiryczną politykę zastępczą gęstości nad przejściami ukrytymi do przydziału kredytu na poziomie trajektorii, oraz głowę zatrzymania nadzorowaną poprawnością, którą optymalizacja outcome-reward refinesuje w politykę zmiennego horyzontu. Wyniki pokazują poprawę Pass@k przy równoległym samplingowaniu i inteligentne przydzielanie dłuższych obliczeń ukrytych instancjom trudniejszym, z wyższą dokładnością deterministyczną.