Naukowcy przedstawili TalkFa, pierwszy kompleksowy benchmark dedykowany dialogom w języku farsi, który zawiera trzy komplementarne zestawy danych. Zbiór obejmuje 4,2 tys. dialogów opartych na Wikipedii dla generowania grounded knowledge, 6,6 tys. dialogów z adnotacjami aktów dialogowych i emocji oraz 2,1 tys. dialogów teatralnych z etykietami sentymentu. Wszystkie dane zostały przejrzane i zatwierdzane przez native speakerów farsi, chociaż wsparcie LLM ułatwiło ich konstrukcję.

Benchmark wypełnia istotną lukę dla farsi, języka mówiącego przez ponad 120 milionów ludzi, który dotychczas nie miał ujednoliconego zestawu do ewaluacji modeli dialogowych. Testy przeprowadzone na sześciu modelach z serii Llama i Mistral wykazały, że fine-tuning LoRA znacząco usprawnia jakość generowania dialogów przy znacznie mniejszym wkładzie danych - wymagając tylko 25-50% danych treningowych, aby osiągnąć ponad 90% końcowych zysków wydajności. W zadaniach klasyfikacyjnych FaBERT osiągnął najlepsze wyniki w rozpoznawaniu aktów dialogowych, Mistral-7B z LoRą wyróżnił się w rozpoznawaniu emocji, a Mistral-24B uzyskał najwyższe wyniki w klasyfikacji sentymentu.

Ważne spostrzeżenie z ewaluacji humanicznej ujawniło, że automatyczne metryki znacząco zawyżają ocenę jakości dialogów w porównaniu z oceną ekspercką i GPT-4.1. Zero-shot evaluation z frontier LLM-ami potwierdza, że TalkFa stanowi wyzwanie benchmark dla zaawansowanych modeli. Autorzy zapewniają udostępnienie wszystkich zbiorów danych, wytycznych anotacji, kodu i punktów kontrolnych, co umożliwi społeczności badaczy pracę nad улучszением wsparcia dla dialogów w języku farsi.