Naukowcy odkryli nowe zjawiska fizyczne zachodzące wewnątrz transformerów podczas ich treningu, które mogą zmienić sposób optymalizacji tych modeli. Badanie skupia się na spektralnych właściwościach macierzy wag w transformerach, czyli na tym, jak rozpределяются wartości własne tych macierzy w różnych fazach uczenia się sieci. Okazuje się, że proces treningowy przebiera przez charakterystyczne fale kompresji - okresy, gdy struktura wewnętrzna modelu intensywnie się zmienia i reorganizuje.

Kluczowe odkrycie dotyczy asymetrii między zapytaniami (Q) a kluczami i wartościami (K-V) w mechanizmie attention, który stanowi serce architektury transformerów. Podczas treningu gradient spektralny - miara, która mówi o tym, jak szybko zmienia się struktura informacji w sieci - utrzymuje się na asymetrycznych poziomach między tymi komponentami. Ta asymetria okazuje się być nie przejściowa anomalią, ale trwałą cechą procesu adaptacji modelu. Zrozumienie tych dynamicznych zjawisk może pomóc w lepszym projektowaniu algorytmów optymalizacyjnych, takich jak ulepszone wersje Adam czy SGD, które byłyby dostrojone do tych naturalnych faz treningu.

Badania tego typu wpływają bezpośrednio na efektywność treningu dużych modeli językowych. Jeśli naukowcy nauczą się pracować z naturalnymi falami kompresji zamiast im opierać się, mogą uzyskać szybszą konwergencję i zmniejszyć zużycie energii obliczeniowej. To szczególnie ważne w kontekście rosnących kosztów trenowania najnowszych modeli takich jak GPT czy Claude, gdzie każda optymalność liczy się w setkach tysięcy dolarów.