Naukowcy opracowali model Nautile-370M, który udowadnia, że nawet bardzo małe sieci neuronowe mogą być zdolne do zaawansowanego rozumowania. Model, liczący zaledwie 370 milionów parametrów, łączy dwie kluczowe techniki: spektralną pamięć oraz mechanizmy attention, osiągając wyniki porównywalne z dużo większymi sieciami.
Spektralna pamięć to innowacyjny sposób przechowywania i wydobywania informacji, który wykorzystuje reprezentacje matematyczne oparte na częstościach. W połączeniu ze standardowym mechanizmem attention - odpowiedzialnym za skupianie się modelu na najistotniejszych elementach tekstu - Nautile-370M może efektywnie przetwarzać złożone problemy rozumowania. To podejście jest istotne, bo standardowe modele tego rozmiaru zazwyczaj borykają się z zadaniami wymagającymi wieloetapowego logicznego myślenia.
Wyniki eksperymentów pokazują, że taka architektura radzi sobie zaskakująco dobrze na testach zdolności rozumowania, a jej efektywność energetyczna robi z niej potencjalnie interesujący kandydat dla wdrożeń na urządzeniach o ograniczonych zasobach. Badanie wskazuje na ścieżkę rozwojową dla budowania bardziej inteligentnych, ale jednocześnie kompaktowych modeli AI - coś, co może być kluczowe dla masowego zastosowania sztucznej inteligencji na smartfonach, IoT-ach i innych urządzeniach brzegowych.