Naukowcy z arXiv przeprowadzili badanie porównujące zdolności pięciu open-source'owych dużych modeli językowych do rozpoznawania i generowania terminów pokrewieństwa w hindi, tamilsku i koreańskim. Odkryli zaskakującą niesymetrię: modele osiągają wysoką dokładność w testach wielokrotnego wyboru, ale drastycznie gorzej radzi sobie przy samodzielnym generowaniu tych terminów.