Metoda GRPO, popularna do trenowania zdolności logicznego rozumowania w modelach języka, dotychczas badana była głównie na angielskich zbiorach danych. Nowe badanie przeprowadzone na arXiv zmienia to podejście - naukowcy przeprowadzili wyczerpującą empiryczną analizę GRPO w kontekście wielojęzycznym, testując różne modele bazowe, języki treningowe i sposoby definiowania nagród za poprawne rozumowanie.
Głównym odkryciem jest to, że szkolenie modelu do rozumowania w jego ojczystym języku praktycznie dorównuje efektom szkolenia do angielskiego. Co więcej, naukowcy zaobserwowali efekt transferu międzyjęzykowego - kiedy model uczy się lepiej rozumować w jednym języku, często poprawia się jego wydajność w wielu innych językach naraz. To obiecujące zjawisko otwiera drzwi do efektywniejszego trenowania modeli dla nieangielskich rynków.
Wada badania to złożoność interakcji: efekty są silnie zależne od konkretnego modelu i konkretnego języka. W niektórych przypadkach intensywne szkolenie w wybranym języku prowadzi do znacznego pogorszenia się zdolności modelu w innych zadaniach i językach. Autorzy podkreślają, że wykorzystanie RLVR poza angielskim może przynieść ogromne korzyści dla aplikacji wielojęzycznych, ale wymaga bardzo szczegółowej oceny każdej kombinacji - bez niej łatwo przeoczyć ukryte regresje wydajności.