Zespół badawczy pokazał, że technika zastrzykiwania fragmentów z pomyślnych ścieżek rozumowania (PPFG) nie przynosi spodziewanego wsparcia dla łańcuchowego myślenia w modelach językowych. Testując Qwen2.5-7B-Instruct z modelem nagród Math-Shepherd na 500 problemach matematycznych z trzema niezależnymi uruchomieniami, metoda PPFG nie wykazała żadnych mierzalnych ulepszeń w porównaniu do standardowego równoległego chain-of-thought.
Problema leży w samym mechanizmie aktywacji. Szczegółowa klasyfikacja 322 zdarzeń, kiedy system podejmował decyzję o wstrzyknięciu fragmentu, ujawniła fundamentalny problem - zaledwie 14 procent trafiło na łańcuchy rzeczywiście borykające się z problemami. Pozostałe 86 procent przypadało na sekwencje, które już osiągnęły sukces, były bliskie ukończenia, albo utkwiły na płaskim plateau modelu procesów nagród, gdzie zastrzyknięty fragment nie może nic zmienić. Nawet najlepsze warianty sterowania, które łączyły lepsze celowanie z wymaganą gęstością aktywacji, nie osiągnęły parytetów wydajności lepszych od losowego wyboru, chociaż losowe strzelanie wymagało 2,4 raza więcej aktywacji.
Wyniki replikują się na trzech różnych modelach bazowych, sześciu benchmarkach, drugim modelu PRM i przy zmianach bramek kompatybilności. To sugeruje, że inercja PPFG nie wynika z konkretnych heurystyk czy projektów systemów, ale z głębszej rozbieżności między tym, gdzie model uważa za bezpieczne interweniować, a gdzie interwencja rzeczywiście może pomóc.