RubricForge to nowa metoda automatycznego generowania kryteriów oceny dla modeli języka, które pełnią rolę sędziów w ewaluacji agentów AI. Problem, który rozwiązuje, jest konkretny: istniejące podejścia jak G-Eval mają tendencję do nadmiernego kredytowania trajektorii, które wyglądają płynnie, ale faktycznie nie osiągają sukcesu - szczególnie problematyczne, gdy rzeczywista nagroda z środowiska jest droga, wolna lub niedostępna.

Systems indukuje tekst rubryk z małego zbioru trajektorii oznaczonych rzeczywistymi wynikami, następnie używa ewolucji refleksyjnej, aby zoptymalizować rubryke względem oznaczonych danych. Kluczowa innowacja polega na tym, że artefakt końcowy jest czytelnym tekstem, a nie po prostu wagami modelu - każdy werdykt można przypisać konkretnym nazwianym kryteriom. Po zamrożeniu rubyki funkcjonuje w jednym wywołaniu modelu bez dostępu do środowiska. Testy na tau-bench (173 trajektorie) i WebShop (160) pokazały, że RubricForge zmniejsza problem nadmiernego kredytowania nieudanych trajektorii w stosunku do istniejących podejść, chociaż surowa zgodność statystyczna nie była znacząco lepsza od generycznego sędziego G-Eval.

Znaczenie tego podejścia tkwi w skalowalności ewaluacji agentów AI. W praktyce produkcyjnej dostęp do rzeczywistych sygnałów nagrody jest ograniczony - procesy mogą być wolne, kosztowne lub wręcz niemożliwe do uruchomienia w czasie deploymentu. RubricForge oferuje autonomiczne rozwiązanie, które jest jednocześnie bardziej wiarygodne niż poprzednie podejścia i przejrzyste dla człowieka, co czyni je cennym narzędziem dla rozwoju i oceny zaawansowanych systemów AI.