Zespół ZeroR opracował system do klasyfikacji memów nepalskich, który zajął drugie miejsce w zadaniu detekcji mowy nienawiści z wynikiem F1 0.797 i czwarte miejsce w analizie sentymentu z wynikiem 0.518. Rozwiązanie opiera się na modelu Qwen3-VL-8B-Instruct, który posiada wbudowane wsparcie dla pisma Devanagari, eliminując konieczność korzystania z oddzielnych narzędzi OCR czy tłumaczenia.

Kluczową innowacją jest dwuetapowy pipeline: pierwszy etap obejmuje fine-tuning LoRA z projekcją MLP do klasyfikacji generatywnej, zaś drugi etap to kontrastywne dopasowanie modelu bazowego z użyciem supervised InfoNCE loss. System radzi sobie z nierównomiernym rozkładem klas poprzez oversampling mniejszościowych, augmentację obrazów i focal loss. Na etapie wnioskowania ensemble łączy prawdopodobieństwa tokenów z pierwszego etapu ze skorami klasyfikatora drugiego etapu, używając wag wytuned na zbiorze walidacyjnym.

Pracę wyróżnia praktyczne podejście do adaptacji dużych modeli wizyjno-językowych do mniej zasobnych języków. Bezpośrednie działanie na tekście nepalskim zamiast tłumaczenia na angielski zmniejsza ryzyko utraty informacji i błędów, które mogłyby się propagować poprzez wieloetapowy pipeline. Badacze dostarczają szczegółową analizę ablacyjną i insights na temat wyzwań związanych z pracą z niskim zasobami dla języków Azji Południowej.