Trenowanie dużych sieci neuronowych wiąże się z ogromnym zużyciem pamięci, a naukowcy znaleźli sposób, aby znacząco je zmniejszyć. Badacze opracowali metodę BASIS, która wykorzystuje inteligentne techniki kompresji aktywacji - czyli danych przechowywanych podczas fazy forward pass, niezbędnych później do obliczenia gradientów. Zamiast zapisywać wszystkie informacje, algorytm selectywnie wybiera i przechowuje tylko najważniejsze wartości, zmniejszając tym samym zapotrzebowanie na pamięć GPU bez pogorszenia jakości treningu.
Trick stoi w zrównoważonym sketchingu, który rozprowadza próbkowanie aktywacji równomiernie na całej sieci. Zamiast losowo wyrzucać dane, metoda BASIS śledzi, które elementy niosą rzeczywiście ważne informacje dla backpropagacji, a które możemy bezpiecznie pominąć. W praktyce oznacza to znacznie szybszą propagację wsteczną - te obliczenia przebiegają sprawniej, ponieważ przetwarzamy mniej danych. Testy pokazują, że przy zmniejszeniu wykorzystania pamięci o kilkadziesiąt procent dokładność modeli pozostaje niezmieniona, co jest kluczowe dla praktycznych zastosowań w przemyśle i badaniach.
Znaczenie tej metody trudno przecenić w świecie sztucznej inteligencji, gdzie model coraz bardziej pojemne wymuszają czasem użytkowników do inwestycji w droższy sprzęt. BASIS otwiera drzwi do bardziej demokratyzacyjnego dostępu do trenowania zaawansowanych modeli - mniejsze zespoły badawcze i startupy będą w stanie uczyć sieci o porównywalnymi parametrami, używając tańszych konfiguracji sprzętowych. Metoda może szczególnie przydać się przy fine-tuningu dużych modeli językowych oraz przy trenowaniu na urządzeniach z ograniczoną pamięcią.