Naukowcy z branży AI opracowali ERR+, nową technikę trenowania dużych modeli łańcuchów myślenia poprzez wzmacnianie uczenia się. Kluczowe odkrycie polega na tym, że modele generujące prawidłowe rozumowanie wykazują bardziej wyraźne spadki entropii na poziomie tokenów w fazie myślenia w porównaniu z błędnym rozumowaniem. ERR+ wykorzystuje tę obserwację w dwufazowym podejściu: najpierw nagradza entropię ulgi (ERR), czyli bonus proporcjonalny do skumulowanych spadków entropii, znormalizowanych względem długości odpowiedzi, a następnie optymalizuje efektywność poprzez nową metrykę wydajności relatywnej.
Dotychczasowe metody wzmacniającego uczenia się w tego typu modelach polegały głównie na sygnałach opartych na poprawności - model dostaje nagrodę za dobrą odpowiedź. Problem polega na tym, że takie podejście nie optymalizuje samego procesu rozumowania, zostawiając wewnętrzną strukturę myślenia w dużej mierze nieoptymalizowaną. ERR+ zmienia to przez bezpośrednie nagradzanie zmniejszania się niepewności podczas myślenia, zamiast jej tłumienia. Analiza formalna wykazuje, że równoczesna optymalizacja obu celów powoduje konflikty gradientów na wczesnym etapie treningu, dlatego autorzy wybrali podejście sekwencyjne.
Badania przeprowadzone na pięciu zbiorach danych wykazały konsekwentne ulepszenia wydajności. Potencjalny wpływ jest znaczący, gdyż lepiej zoptymalizowane procesy myślenia mogą prowadzić do bardziej niezawodnego rozumowania w złożonych zadaniach, a jednocześnie do krótszych, bardziej efektywnych ścieżek myślenia - co jest kluczowe dla praktycznego wdrażania takich modeli.