Badacze odkryli, że transfer cech podprogowych - proces, w którym model przejmuje cechy behawioralne z danych, które nie wyrażają tych cech w jawny sposób - zależy w krytycznym stopniu od stanu optymalizatora, a konkretnie od jego pierwszego momentu. Problem polega na tym, że sygnały wchodzą do gradientów podczas treningu, przetrwają usunięcie źródła i mogą przybrać całkowicie różne znaki w zależności od kontynuacji procedury treningowej.

Zasadniczym wkładem badaczy jest wprowadzenie pojęcia state surgery - techniki pozwalającej na izolowanie i testowanie konkretnych komponentów stanu trenera (parametrów i momentów optymalizatora). Okazało się, że transplantacja samego pierwszego momentu bez zmiany parametrów pozostawia ukryte stany i wyjścia modelu niezmienione w punkcie cięcia, ale po kilku update'ach bez źródła zaczynają pojawiać się rosnące różnice. To świadczy, że pierwszy moment jest rzeczywiście nośnikiem przesyłanego sygnału.

Najbardziejmożna zaobserwować poprzez eksperymenty na modelach Qwen i Llama-3.2-1B. Gdy ten sam induowany przez źródło rozbieżność stanu przechodzi przez różne przyszłe procedury treningowe, wyniki mogą być dramatycznie różne - od -0.658 do +0.658 w średniej. Ta sama trajektoria przechodzi do całkowicie odwrotnych efektów behawioralnych. Badacze wykazali, że pełny horyzont costate - narzędzie pochodzące z teorii kontroli - potrafi przewidywać te znaki dla wszystkich testowanych konfiguracji, co otwiera nowe możliwości rozumienia i kontrolowania niezamierzonych transferów cech w sieciach neuronowych.