Zespół DS@GT opracował system do weryfikacji numerycznych twierdzeń w zadaniu CheckThat 2026, które wymaga oceny śladów rozumowania generowanych przez duże modele języka i przewidywania końcowego werdyktu dla twierdzeń zawierających liczby. Badacze testowali dwa główne podejścia - pierwsze opierało się na fine-tuningu LLM-u za pomocą LoRA do niezależnego oceniania każdego śladu jako problemu klasyfikacji binarnej, z użyciem selekcji Best-of-N dla ostatecznego wyniku, podczas gdy drugie zastosowało lekki model reward oparty na TF-IDF z ręcznie przygotowanymi cechami dotyczącymi pokrywania się liczb i dat.

Wyniki pokazują wyraźną przewagę podejścia opartego na LLM-ach, szczególnie w metryce Recall@5, choć model oparty na reward wypadł lepiej w klasie Conflicting. Warto zauważyć, że automatyczne rozbijanie twierdzeń na podtwierdzenia nie poprawiło wyników, sugerując że dzielenie twierdzeń wprowadza szum zamiast wspierać rozumowanie. W przypadku arabskiego AraBERT, model specjalistyczny przeszkolony na tekście arabskim, wypadł lepiej od ogólnego modelu wielojęzycznego, co podkreśla znaczenie języka specjalistycznego w weryfikacji faktów.

Badanie jest istotne dla automatyzacji fact-checkingu w erze rosnącej liczby fałszywych informacji, szczególnie dotyczących danych liczbowych. Wyzwanie stanowi połączenie głębokich zdolności rozumowania z precyzją w analizie liczb, zwłaszcza w kontekście wielojęzycznym. Rozwój tych systemów może wspomagać dziennikarzy i fact-checkerów w szybkiej ocenie twierdzeń liczbowych, jednak wyniki pokazują, że zarówno podejścia zaawansowane jak i uproszczone mają swoje mocne strony w zależności od kontekstu.