Badacze opracowali SuTRA - algorytm tokenizacji uwzględniający morfologiczną strukturę języków indyjskich, rozwiązując problem zwany Morphological Shattering. Istniejące metody takie jak BPE optymalizują kompresję statystyczną, ale ignorują związki między pierwiastkami słów a przyrostkami morfologicznymi, co szczególnie szkodzi w językach morfologicznie złożonych, gdzie podstawowymi jednostkami są skomplikowane sylaby ortograficzne zwane aksharami.

SuTRA wprowadza nowe podejście do tokenizacji poprzez penalizowanie podziałów przekraczających granice morfologiczne i zachowywanie niepodzielności akshar. Naukowcy przygotowali również nowy dataset do segmentacji morfologicznej dla Hindi, Marathi i Gujarati. W eksperymentach algorytm zmniejszył fragmentację słów, osiągając wzrost wyrównania morfologicznego (Boundary F1) o 14,7 procent oraz poprawę odzyskiwalności semantycznej o 34 procent w stosunku do BPE na języku Hindi.

Praktyczne rezultaty pokazują średnią poprawę tłumaczenia maszynowego o 8,08 punktów chrF2, co sugeruje, że respektowanie morfologicznej struktury słów ma realny wpływ na jakość modelowania języka naturalnego. Odkrycie jest istotne dla rozwijania lepszych systemów NLP dla języków indyjskich, które stanowią wyzwanie dla narzędzi trenowanych głównie na danych z języków europejskich.