Naukowcy z arXiv opublikowali badanie pokazujące, że modele AI mogą ocenić powodzenie swoich działań poprzez analizę wewnętrznych reprezentacji zamiast obserwacji bezpośrednich wyników. Problem jest realny - agenctyczne systemy działające w krytycznych zastosowaniach muszą wiedzieć, czy wykonują zadania poprawnie, ale tradycyjne miary pewności nie radzą sobie dobrze ze złożonymi scenariuszami planowania i interakcji ze środowiskiem.
Badacze zaproponowali dwie komplementarne metody. Pierwsza - Latent Trajectory Dynamics (LTD) - śledzi zmiany w reprezentacjach modelu na przestrzeni całej sekwencji interakcji, by podsumować dynamikę procesu. Druga - Action Representation Probe (ARP) - przewiduje sukces bezpośrednio z reprezentacji formowanych w momencie podejmowania decyzji. Przetestowali to na trzech benchmarkach (Bash, SQL, Python) z wykorzystaniem trzech rodzin modeli: Qwen14B, Qwen7B i DeepSeek6.7B.
Wyniki pokazują, że oba podejścia konsekwentnie przewyższają tradycyjne kalibracje oparte na analizie generowanego tekstu czy sekwencji tokenów. Co ważne, proponowane rozwiązania działają bez dodatkowych kosztów obliczeniowych, nie wymagają zmian promptów ani generowania wielu wariantów odpowiedzi. To stanowi praktyczne narzędzie do monitorowania niezawodności agentów AI w rzeczywistych zastosowaniach.