Naukowcy z arXiv zbadali, czy szacunki odległości zależności między wyrazami w zdaniach są stałą właściwością języka, czy zależy to od wyboru korpusu tekstów użytego do analizy. Porównali dane z 38 par TreeBanków dotyczących tych samych języków pochodzących z bazy Universal Dependencies v2.18, używając zaawansowanych metod statystycznych w tym analizy Blanda-Altmana oraz projektowania multiverse obejmującego dwanaście różnych wariantów przetwarzania danych.
Wyniki pokazały, że zgodność między różnymi TreeBankami była co najwyżej umiarkowana. Zastąpienie jednego TreeBanku innym dla tego samego języka odwróciło prawie 40 procent rankingów porównujących pary języków, a sama zmiana TreeBanku odpowiadała za około 29 procent całkowitej wariancji wyników między grupami. Ta rozbieżność znacznie przewyższała błędy próbkowania wynikające z wielkości danych w ramach jednego TreeBanku i utrzymywała się konsystentnie we wszystkich dwunastu testowanych specyfikacjach przetwarzania danych.
AlgorytmWciąż jednak każdy TreeBank potwierdził uniwersalną tendencję języków do minimalizacji długości zależności syntaktycznej. Badacze wnioskują, że średnia długość zależności powinna być rozumiana raczej jako złożony wynik nieoczywistej kombinacji czynników gramatycznych, stylu tekstu i konwencji anotacji w danym korpusie, niż jako stabilny parametr charakteryzujący język na poziomie fundamentalnym. Oznacza to, że chociaż ogólna zasada działa uniwersalnie, względne uszeregowanie języków ze względu na tę metrykę zmienia się w zależności od tego, których danych korpusowych się używa.