Naukowcy z arXiv CS.CL wprowadzili XHotpotQA - nowy kontrolowany benchmark do testowania zdolności systemów AI do łączenia faktów pochodzących z różnych źródeł w różnych językach. Do tej pory multilingualne benchmarki zazwyczaj tłumaczyły całe przykłady na jeden język, co maskuje rzeczywiste problemy pojawiające się na granicach między językami podczas wnioskowania.
XHotpotQA zawiera 15,661 przykładów treningowych i 7,405 do walidacji, gdzie każdy przykład ma wyraźnie przypisane języki dla pytania, dowodów mostowych, dowodów zawierających odpowiedź i elementów rozpraszających. W zbiorze walidacyjnym 99,81% elementów wymaga przekroczenia granicy między językiem pytania a językiem dowodów, a 95,60% wykorzystuje referentowe paragrafy w różnych językach. Rezultaty pokazują dramatyczne spadki wydajności: pełna niezgodność między językiem pytania a językiem dowodów to 10-16 punktów mniej w F1, a dowody w różnych systemach pisma (np. łacińskim i chińskim) skutkują stratą nawet 24 punktów.
Benchmark jest ważny dla rozwoju rzeczywistych systemów sztucznej inteligencji, bo ujawnia, że obecne modele mają znaczne słabości w pracy z wielojęzyczną wiedzą. XHotpotQA pozwala na modulową ewaluację i stanowi audytowany poligon doświadczalny dla systemów opartych na wiedzy, które muszą integrować dowody z różnych języków - coraz bardziej ważne w globalnym internecie.