Naukowcy zaprezentowali TatBLiMP - nowy benchmark do oceny umiejętności gramatycznych modeli języka tatarskiego, języka należącego do grupy Qypczackich języków tureckich. Benchmark zawiera 1248 par minimalnych zdań, gdzie każda para różni się dokładnie jednym morfemem - jeden element jest zdaniem gramatycznie poprawnym a drugi błędnym. Model przechodzi test, gdy przypisze wyższą probabilność zdaniu poprawnym.

Benchmark pokrywa 16 różnych zjawisk morfosyntaktycznych tatarskiego i był adaptowany z istniejącego TurBLiMP dostosowanego do tureckiego. Zespół dodał jedno zjawisko specyficzne dla tatarskiego - zachowanie liczby rzeczownika po liczebnikach i kwantyfikatorach. Każde zdanie pochodzi z rzeczywistego tatarskiego piśmiennictwa lub jest tworzone za pomocą automatycznych reguł tworzących typowe błędy. Wszystkie pary zostały zweryfikowane przez native speakera, a sama konstrukcja opiera się na zasadzie wiarygodności - błędy są takie, jakie mogłyby pojawić się naturalnie.

To jest znaczący wkład dla językoznawstwa obliczeniowego, bo tatarski nie był wcześniej objęty żadnym benchmark'iem grammaticalności, mimo że jest językiem z milionami mówiących. Narzędzie pozwala testować zarówno modele uczone od zera, jak i modele multilingwalne czy cross-lingwalne adaptacje - wszystko bez potrzeby generacji tekstu czy parsowania, co czyni go uniwersalnym i praktycznym dla szerokiego spektrum architektur modelowych.