Modele językowe są coraz częściej używane do przeprowadzania otwartych symulacji strategicznych wargames, ale secondo nowego badania z arXiv tego typu systemy są zbyt niebezpieczne, aby wpływać na rzeczywiste decyzje planistyczne i politykę kryzysową bez audytu bezpieczeństwa. Problem tkwi w tym, że te same cechy, które czynią LM-y przydatnymi - zdolność do modelowania antagonistów, generowania gałęzi scenariuszy i arbitrażu niejednoznacznych działań - stanowią źródło zagrożeń.

Badacze identyfikują pięć krytycznych trybów awarii. Decision laundering to problem, gdy język modelu ukrywa rzeczywisty wpływ agenta. Adjudication opacity oznacza brak przejrzystości w tym, jak system ocenia wyniki działań. Role collapse to zawalenie się granic między rolami agentów. Escalation-through-adjudication to spirala, w której sam proces arbitrażu pogarsza konflikt. Wreszcie failure of strategic imagination to niezdolność modelu do rzeczywiście nowatorskiego myślenia taktycznego. Papier jasno stwierdza, że standardowe benchmarki do ewaluacji modeli nie mogą potwierdzić bezpieczeństwa w tych kontekstach decyzyjnych o wysokich stawkach.

Autorzy nie mówią, by całkowicie porzucić wargames oparte na LM-ach. Zamiast tego argumentują, że ich właściwe wykorzystanie dzisiaj to stress-testing - użycie do odkrywania braków w systemach. Takie symulacje mogą być cennymi narzędziami badawczymi, ale nie powinny nigdy bezpośrednio informować rzeczywistej doktryny wojskowej, planowania lub odpowiedzi kryzysowej bez gruntownych, audytowalnych studów bezpieczeństwa.