Naukowcy pracujący nad metodą ACSD opracowali nowy sposób na to, żeby modele AI uczyły się od samych siebie poprzez analizę własnych poprawnych rozwiązań. Zamiast polegać na referencyjnych tekstach lub aktualizacjach parametrów nauczyciela, metoda wyodrębnia wektory sterujące poprzez badanie aktywacji neuronowych - w uproszczeniu, jak "myśli" model przy generowaniu poprawnych odpowiedzi.

Aktywnym elementem procesu jest kontrast: porównanie trajektorii, które osiągają zweryfikowane poprawne odpowiedzi, z tymi, które zawodzą. Zamrożona kopia modelu bazowego aplikuje wyodrębniony wektor na każdej pozycji predykcji, podczas gdy uczeń uczy się na podstawie rozkładów następnego tokena na prefixach generowanych przez siebie. Weryfikacja wyniku służy zarówno do konstruowania kierunku jak i kalibracji procesu.

Wyniki są imponujące. Na modelu DeepSeek-R1-0528-Qwen3-8B ACSD osiągnęła średnią dokładność 71,9 procent na benchmarkach matematycznych i 70,9 procent w LiveCodeBench v6 pass@12, co znacznie przewyższa baseline OPSD, który uzyskał 69,0 procent i 66,3 procent. Co ważne, zamiast uczyć się słowami, metoda działa na poziomie aktywacji, co pozwala jej być bardziej stabilną i efektywną. Wyodrębzone wektory można też przenosić między różnymi zestawami danych treningowych, co zwiększa elastyczność i praktyczną użyteczność podejścia.