Naukowcy zaprezentowali framework A-CEGIS, który zmienia sposób oceny agentów AI w wieloturowych scenariuszach refinacji. Zamiast tradycyjnych metryk generowania kodu w pojedynczej turze, system wykorzystuje kontrprzykłady jako precyzyjne sprzężenie zwrotne - gdy agent zaproponuje rozwiązanie (regex), deterministyczny orakel je sprawdza i dostarcza konkretne przykłady, w których rozwiązanie się myli.

Wyniki na zbiorze 30 zadań NL-RX-Turk pokazują dramatyczną różnicę w wydajności. Generowanie bez wskazówek rozwiązało zaledwie 17% zadań, ogólna samokorekta 27%, a feedback tylko o błędach 23%. Tymczasem kontrprzykłady diagnostyczne osiągnęły 90% rozwiązań w ramach czterorundowego budżetu, a w pełnym przebiegu z ulepszeniami wszystkie zadania zostały rozwiązane ze średnią 2,7 tur do sukcesu.

To ważne, bo pokazuje fundamentalną lukę w obecnych metrykach - skupiamy się na tym, czy model coś wygeneruje za pierwszym razem, ale ignorujemy jego zdolność do nauki z opinii i samonaprawy. Framework A-CEGIS mierzy tę właściwość i wskazuje na praktyczną drogę do bardziej niezawodnych systemów, które mogą iteracyjnie ulepszać swoje wyniki na podstawie konkretnego sprzężenia zwrotnego.