Naukowcy z arXiv CS.LG opracowali SharedSAE - metodę pozwalającą na użycie jednego wspólnego słownika do interpretacji aktywacji w wielu modelach językowych. Zamiast trenowania oddzielnego sparse autoencoder dla każdego modelu, nowe podejście łączy jeden współdzielony słownik cech z parami enkodera-dekodera dostosowanymi do poszczególnych modeli.

Właściwością SharedSAE jest normalizacja wyłącznie wyników selekcji, co zachowuje rzeczywiste magnitudy aktywacji - w przeciwieństwie do wcześniejszych metod, które porzucały te informacje. Model wykorzystuje dropout do efektywnej pracy z pojedynczymi modelami przy wnioskach. W eksperymentach przeszkolonym na czterech modelach o skali 1B miliardu parametrów z różnych rodzin i tokenizatorami metoda osiągnęła 96,6 procenta średniej wyjaśnionej wariancji dedykowanych SAE.

Znaczące jest, że aktywacje ukryte w SharedSAE wykazują korelacje między modelami 1,8 raza wyższe niż w oddzielnych SAE wyrównanych post-hoc, a opisy cech przenoszą się między modelami. Po zamrożeniu słownika nowe modele mogą być efektywnie adaptowane do istniejącej struktury, osiągając jakość rekonstrukcji zbliżoną do dedykowanych SAE przy ponownym wykorzystaniu wspólnych opisów cech. To podejście ma potencjał znacznie obniżyć koszty obliczeniowe interpretacji sieci neuronowych w przyszłości.