Naukowcy opracowali nową architekturę transformera, która czerpie inspirację z teorii kategorii - abstrakcyjnego działu matematyki zajmującego się strukturami i relacjami między nimi. Zamiast tradycyjnych mechanizmów uwagi, model wykorzystuje matematyczne struktury kategorii do modelowania zależności w tekście, co ma zwiększyć efektywność uczenia i przetwarzania języka naturalnego. To połączenie głębokich sieci neuronowych z zaawansowaną matematyką stanowi nowy kierunek w poszukiwaniu bardziej wydajnych architektur transformerowych.
Główną ideą badania jest wprowadzenie specjalnych indukcyjnych uprzedzeń - wbudowanych założeń matematycznych o strukturze języka - które pozwalają modelowi lepiej rozumieć i reprezentować relacje między słowami i frazami. Tradycyjne transformery, takie jak te leżące u podstaw GPT-4 czy BERT-a, stosują mechanizmy uwagi działające w zasadzie uniwersalnie dla każdego wejścia. Nowe podejście wykorzystuje kategorie matematyczne do precyzyjnego definiowania, jakie relacje między elementami tekstu są możliwe i ważne, co powinno zmniejszyć ilość obliczeń i zmniejszyć problemy z interpretowalnością modeli.
Jeśli badanie potwierdzi swoją użyteczność, mogłoby to doprowadzić do znacznie bardziej wydajnych modeli języka, które wymagałyby mniej mocy obliczeniowej niż obecne rozwiązania. Równie istotne byłoby jednak udoskonalenie interpretacji decyzji modelu - jeden z największych wyzwań w AI. Łączenie matematyki teoretycznej z praktyką deep learningu otwiera drogę do bardziej przejrzystych i zoptymalizowanych systemów przetwarzającego język naturalny, choć zastosowanie abstrakcyjnej teorii kategorii w produkcyjnych systemach będzie wymagać dalszych badań i weryfikacji.