Zespół badawczy opracował COILD - nowy benchmark i korpus treningowy dla maszyn tłumaczenia (MT) między językami indyjskimi. Zbiór zawiera ponad 1,16 miliona par zdań tłumaczonych i zweryfikowanych przez ludzi dla 20 kombinacji języków indyjskich, obejmujących języki z rodzin indo-aryjskich, drawidyjskich, tybeto-birmańskich i austro-azjatyckich. Ważne jest, że materiały pochodzą bezpośrednio z oryginalnych źródeł w językach indyjskich z ośmiu dziedzin, a nie z tłumaczeń pośrednich przez angielski.

Dotychczasowe rozwiązania w tłumaczeniu maszynowym dla języków indyjskich cierpiały na brak wysokiej jakości danych treningowych oraz brakowało im zrozumienia dla złożoności lingwistycznej i kulturowej charakterystycznej dla tych języków. Istniejące zasoby wielojęzyczne były głównie konstruowane z angielskiego punktu oparcia, co powodowało utratę specyficznych cech języków indyjskich i charakterystyki poszczególnych dziedzin.

Badacze przetestowali COILD na dwóch reprezentatywnych modelach tłumaczenia neuronowego - IndicTrans2-Distilled i NLLB-200. Wyniki pokazały konsekwentne poprawy dla wszystkich par języków, dziedzin oraz zarówno automatycznych jak i ręcznych miar oceny. Dodatkowo stworzyli benchmark z 2000 zdań zweryfikowanych przez ekspertów, umożliwiający spójną ocenę tłumaczeń między językami indyjskimi.