Międzynarodowy zespół badaczy odkrył istotną lukę w tym, jak dobrze modele językowe radzą sobie z różnymi językami. Gdy ta sama zawartość tekstu zostaje przetłumaczona z angielskiego na inny język, modele tracą średnio 17 procent wydajności - efekt nazwany Cross-Lingual Comprehension Gap (CLCG), czyli luką w wielojęzycznym zrozumieniu.
Badanie wykorzystało specjalny zbiór danych ParallelQA-18 zawierający profesjonalnie przetłumaczone teksty w 18 językach. Naukowcy testowali pięć dużych modeli z pięciu laboratoriów na 150 artykułach, zmieniając tylko język zawartości przy zachowaniu wszystkich innych zmiennych - pytania, odpowiedzi referencyjne i sposobu oceny. Średnia strata wyniosła 7,8 procent w przeliczeniu na Token-F1, czyli metrykę mierzącą trafność odpowiedzi na złożone pytania otwarte. Wyniki były zróżnicowane - języki zasobne triadały lepiej niż te mniej zasobne, co potwierdziło statystyczną korelację między dostępnością danych treningowych a spadkiem wydajności.
Znajdowanie potwierdziło, że popularne wielojęzykowe benchmarki mogą być mylące, bo oceniają możliwości AI jakby były одинаkovie dostępne w każdym języku. W rzeczywistości modele wytrenowane głównie na angielszczyźnie wykazują gorzsze zrozumienie w innych językach, nawet gdy treść jest identyczna. To ma znaczenie dla organizacji i firm korzystających z AI na całym świecie - trzeba liczyć się z tym, że asymetryczne wsparcie języków może wpłynąć na dokładność systemów.