Naukowcy opracowali nową technikę optymalizacji modeli Mixture-of-Experts, która pozwala na znaczące zwiększenie wydajności bez proporcjonalnego wzrostu kosztów obliczeniowych. Chodzi o bardziej inteligentne wykorzystanie specjalistycznych modułów neuronowych, których zadaniem jest analizowanie różnych aspektów danych wejściowych. To przełom w budowaniu sprawniejszych sztucznych sieci neuronowych, bo dotychczasowe podejścia często wymagały ogromnych zasobów komputerowych. Badacze pokazali, że można uzyskać lepsze wyniki przy mniejszym zużyciu energii i czasu trenowania.
Mixture-of-Experts to architektura, w której zamiast jednej ogromnej sieci neuronowej pracuje wiele mniejszych „ekspertów", każdy specjalizujący się w innym rodzaju zadania. System automatycznie przesyła dane do odpowiedniego eksperta w zależności od treści. Problem polegał dotąd na tym, że te sieci były niedostatecznie efektywne - wiele parametrów modelu nie było w pełni wykorzystywane. Nowa technika upcyclingu rozwiązuje właśnie to zagadnienie, uaktywniając ukryte potencjały już istniejących struktur.
Wyniki tej pracy mogą mieć praktyczne znaczenie dla firm pracujących nad dużymi modelami językowymi i systemami AI. Jeśli optymalizacja Mixture-of-Experts rzeczywiście prowadzi do lepszych modeli przy mniejszych wydatkach, to zarówno big techy, jak i mniejsze startupy uzyskają dostęp do bardziej wydajnych narzędzi AI. To także oznacza mniejszy ślad węglowy takich operacji - mniej energii zużywanej na trenowanie oznacza mniej szkód dla środowiska.