Zespół badawczy opracował strategię inicjalizacji embeddings dla nieznanego języka Limbum, jeden z rzadkich języków Grassfields Bantu z Kamerunu, które nie są wspierane w modelu NLLB-200 pokrywającym 200 języków. Zamiast wybierać jeden proxy token języka na podstawie intuicji, zaproponowali uśrednianie embeddings z wielu języków typologicznie podobnych już присутnych w modelu.
Badacze porównali cztery podejścia do tłumaczenia Limbum-angielski: zero-shot NLLB-200 osiągnął 12,5 chrF2++, Transformer trenowany od zera uzyskał 14,5, NLLB-200 fine-tunowany z proxy tokenem Suahili zdołał 47,3, a ich metoda uśredniania embeddings z wielu języków osiągnęła 46,7 chrF2++. Obie wersje NLLB-200 poprawiły wyniki o ponad 32 punkty w stosunku do modelu trenowanego od nowa, co potwierdza dominującą rolę transferu wielojęzycznego w ekstremalnie niskozasobowych scenariuszach.
Chociaż metoda działa efektywnie, wszystkie systemy miały problemy z zachowaniem tonalnych znaków diakrytycznych w Limbum - to pozostaje otwartym wyzwaniem. Naukowcy udostępnili zbiór danych zawierający 8837 par zdań z tekstu Nowego Testamentu i słownik dwujęzyczny, a także kod implementacji, co powinno wspomóc dalsze badania nad tłumaczeniem niedoreprezentowanych języków afrykańskich.