Naukowcy z uniwersytetów i firm badawczych opracowali XiangqiBench - pierwszy interaktywny benchmark do ewaluacji agentów LLM grających w szachy chińskie. Benchmark zawiera 119 endgamów z wymuszonymi matami, a agenci konkurują przeciwko silnikowi szachowemu w pełnym cyklu gry: muszą nie tylko znaleźć prawidłowy ruch, ale go wykonać, obserwować odpowiedź przeciwnika i dojść do szachomata. Wyniki są zaskakujące: podczas gdy modele wskazują prawidłowy pierwszy ruch w 26,1 proc. prób, zaledwie 13,9 proc. z tych partii kończy się faktycznym zwycięstwem.
Badacze zidentyfikowali trzy fundamentalne luki w ocenie zdolności agentów. Po pierwsze - luka konwersji: znalezienie dobrego ruchu to nie to samo co wygranie partii. Po drugie - luka konsystencji: najlepszy model osiąga 38,7 proc. sukcesu w trzech próbach (pass@3), ale zaledwie 5,9 proc. wygrywa wszystkie trzy partie na tej samej pozycji. Po trzecie - luka symulacji: aż 32,3 proc. ruchów symulowanych przez agenta jest nielegalnych, a w 49,3 proc. przypadków silnik broni się inaczej niż przewidywał agent.
To badanie ujawnia głęboką różnicę między statyczną oceną modelów a rzeczywistą grą z przeciwnikiem. Modele mogą być dobre w nazwaniu prawidłowego ruchu, ale tracą się w dynamicznej grze gdzie muszą reagować na decyzje oponenta i trzymać wieloposażkowy plan. Wyniki sugerują, że agenci AI potrzebują lepszego modelowania przeciwnika oraz zdolności do adaptacji, a ewaluacje powinny mierzyć zamknięte pętle gry, a nie pojedyncze ruchy.