Zespół badawczy zdemonstrował, że embedingi diachtoniczne - współczesny standard do śledzenia zmian semantycznych słów w czasie - mogą być skutecznie stosowane do sanskrytu, starożytnego języka o niskiej dostępności zasobów. Będą to pierwsze zastosowanie tego podejścia na języku o tak złożonej strukturze morfologicznej, gdzie fuzja fonologiczna zwana sandhi, odmiany wyrazów i złożenia stanowią wyjątkowe wyzwanie.
Naukowcy zgromadzili korpus obejmujący 2,7 miliona tokenów rozprzestrzenionych na cztery kanoniczne okresy historyczne sanskrytu. Kluczowym elementem metodologii był neuronowy splitter sandhi na poziomie bajtów wraz z lematyzatorem, które pozwoliły na prawidłowe rozpoznanie granic słów i ich podstawowych form. Dla każdego okresu trenowali oddzielne embedingi, testując różne konfiguracje, aby znaleźć najlepsze podejście dla tego konkretnego języka.
Walidacja systemu wykazała imponujące wyniki - na 21 testowanych zmian semantycznych, 19 przesunęło się w kierunku potwierdzonym przez historyczne badania filologiczne, z statystyczną istotnością p=0,00011. To sugeruje, że embedingi diachtoniczne rzeczywiście mogą wychwytać rzeczywiste zmiany w znaczeniu słów zachodzące w procesach językowych Sanskrit. Praca otwiera perspektywy dla badania ewolucji semantycznej w innych starożytnych i słabo zbadanych językach, wymagając jednak dostosowania metod do specyficznych wyzwań morfologicznych każdego z nich.