Naukowcy zaprezentowali NE-BERT, nowy model języka naturalnego stworzony specjalnie dla dziewięciu języków północno-wschodnich Indii. Model wytrenowano na zbiorze 8,3 miliona zdań obejmujących języki północno-wschodniego regionu Indii oraz hindi i angielski jako języki zakotwiczające. To rozwiązanie wypełnia znaczącą lukę, ponieważ te języki były dotychczas niemal całkowicie marginalizowane przez istniejące modele wielojęzyczne.

NE-BERT osiąga imponujące rezultaty w benchmarkach. Model outperformuje konkurencyjne rozwiązania, osiągając 15,97-krotnie niższą średnią perplexity w porównaniu z IndicBERT-V2 i 7,64-krotnie w stosunku do MuRIL. Kluczowym wkładem jest lepsze radzenie sobie z ekstremalnie słabo reprezentowanymi językami - autorzy zastosowali agresywne strategie resamplingu dla języków takich jak Pnar (zaledwie 1002 zdania w zbiorze treningowym) i Kokborok (2463 zdania). Własny tokenizer SentencePiece Unigram wykazał 1,50-krotnie lepszą efektywność tokenizacji niż mBERT.

Naukowcy przeprowadzili również walidację na zadaniu etykietowania części mowy dla trzech języków północno-wschodnich, co potwierdziło praktyczną przydatność modelu. Cały kod, zbiory testowe i corpus treningowy zostały udostępnione na licencji CC-BY-4.0, co ma wspierać nie tylko badania nad przetwarzaniem języka naturalnego, ale także cyfrową inkluzję mniejszościowych społeczności lingwistycznych Indii.