Badanie naukowe wykazało, że współczesne wielojęzyczne modele językowe popełniają fundamentalne błędy przy tworzeniu tekstów w języku urdu. Naukowcy z instytucji badawczych przeanalizowali 93 opowiadania wygenerowane przez trzy zaawansowane LLM-y - GPT-5.1, Qwen-3-Max i DeepSeek-3.1 - używając szczegółowej klasyfikacji błędów obejmującej dziewięć kategorii lingwistycznych, semantycznych i kulturowych.

Zdolności współczesnych LLM-ów do obsługi języków niskoobsługiwanych takich jak urdu pozostają słabo zbadane, mimo iż modele te są coraz częściej wdrażane do generowania otwartotekstowych tekstów. Problem jest znaczący ze względu na ogromną liczbę użytkowników tych języków na całym świecie. Wyniki pokazały, że wygenerowane historie zawierały krytyczne braki w spójności narracyjnej, nienaturalne powtórzenia oraz wyraźny brak głębi w reprezentacji aspektów kulturowych urdu.

Szczególnie alarmujące jest, że nawet zaawansowane techniki jak few-shot prompting nie rozwiązały większości problemów związanych z błędami kulturowymi i kontekstowymi. Odkrycie to wskazuje na poważne ograniczenia obecnych LLM-ów jako wiarygodnego źródła generowania treści i wyszukiwania informacji dla języków o ograniczonej dostępności danych treningowych. Badanie podkreśla pilną potrzebę doskonalenia wielojęzycznych modeli językowych, aby mogły one odpowiednio obsługiwać języki poza anglojęzycznym mainstream.