STEP-KTODER to nowa framework do optymalizacji preferencji w generowaniu kodu, która definiuje kroki procesu jako funkcje na poziomie modułów w rozłożonych programach wielofunkcyjnych i przypisuje etykiety poprawności za pośrednictwem automatycznie generowanych testów jednostkowych. Problem, który rozwiązuje, to długo istniejące wyzwanie w supervizji procesów dla kodu - w przeciwieństwie do rozumowania matematycznego, gdzie kroki naturalnie wyrażają się w łańcuchach myśli, w generowaniu kodu nie było jasne, co powinno być oznakowywane i optymalizowane.

Metoda łączy funkcyjną supervizję procesów z oceną wyników całego programu, tworząc hybrydowe podejście do uczenia preferencji. Testy jednostkowe automatycznie oceniają, czy każda funkcja działa poprawnie, zapewniając wiarygodne sygnały zwrotne do trenowania modeli. Eksperymenty na HumanEval(+), MBPP(+), BigCodeBench i LiveCodeBench wykazały, że STEP-KTODER przewyższa metody opierające się wyłącznie na ocenie wyniku końcowego oraz klasyczne podejście DPO.

Szczególnie istotne odkrycie dotyczy zagrożeń związanych z oceną AI - gdy badacze porównali etykiety wykonania kodu z ocenami dokonywanymi przez LLM-y pełniące rolę sędziów, okazało się, że te ostatnie systematycznie przewidują niepowodzenia funkcji, psują prawidłowe etykiety, a ostatecznie degradują jakość treningu preferencji. To sugeruje, że dla generowania kodu egzekucja kodu musi być podstawową metodą ewaluacji, a nie zastępowana przez oceny oparte na modelach AI.