Naukowcy opracowali CriticGen, framework ewaluacji modeli językowych, który transformuje ocenę z generycznej na generowaną w kontekście konkretnej zadania. Zamiast tradycyjnych metryk oceniających odpowiedzi w oderwaniu od procesu generowania, nowy system najpierw identyfikuje wymiary ewaluacji właściwe dla danego problemu - zarówno wymiary subiektywne, obiektywne, jak i te wynikające z samouczenia modelu. Te kryteria funkcjonują jako dynamiczna rubryką, którą model stosuje do równoczesnego wytworzenia: oceny numerycznej, uzasadnienia, wykonywalnej sugestii udoskonalenia oraz faktycznie ulepszonej odpowiedzi.

Kluczową zaletą CriticGen jest połączenie diagnozowania błędów z możliwością ich naprawy. Tradycyjne systemy ewaluacyjne mówią modelowi co jest nie tak, ale nie wskazują konkretnie jak to naprawić. Tu rubryka warunkuje proces refinementu, pozwalając modelom zidentyfikować dokładnie gdzie tkwi problem i co zmienić. Eksperymenty wykazały, że ewaluacja powinna być zarówno instancja-specyficzna, jak i działalna - to właśnie zagwarantowało lepsze wyniki niż podejścia generyczne.

Wyniki eksperymentów są obiecujące: CriticGen osiągnął korelacje Pearsona na poziomie 0.9556 i Spearmana 0.9560, znacznie przewyższając poprzednie podejścia. F1 dla sugestii polepszenia wzrósł z 0.5994 do 0.7900, a najważniejsze - w praktyce framework udoskonalił 73.17 procent odpowiedzi z 93.28 procentowym wskaźnikiem braku pogorszenia pozostałych. To oznacza, że feedback rzeczywiście transluje się na poprawę jakości, nie tylko teoretycznie, ale w faktycznych zastosowaniach modeli.