Naukowcy z arXiv zaproponowali TRACE Bench, nową metodę ewaluacji modeli AI pracujących w trybie roleplay-agentycznym, która znacznie bardziej szczegółowo analizuje zdolności modelu niż dotychczasowe podejścia. Zamiast przyznawać pojedynczą ocenę, system rozkłada profil roli na listę kontrolną, a następnie używa User Agent do naturalnej rozmowy z testowanym modelem, jednocześnie śledzając, które elementy listy zostały spełnione na podstawie rzeczywistych odpowiedzi.
Kluczową przewagą TRACE Bench jest transparentność - każda ocena odnosi się do konkretnych punktów listy kontrolnej i fragmentów dialogu, które ją wspierają. To kontrastuje z tradycyjnymi metodami opartymi na wrażeniu holistycznym. Porównanie z popularnymi benchmarkami pokazuje skalę problemu: transkrypty free-chat z MiniMax Role-play Benchmark pokrywają zaledwie 73,74% istotnych elementów profilu roli, natomiast TRACE Bench w mniejszej liczbie tur osiąga 99,91% pokrycia. Robustness testy potwierdzają, że ranking modeli pozostaje stabilny przy powtarzanych uruchomieniach i zmianach User Agent.
Metoda otwiera też drogę do Closed-Loop Benchmark Evolution - systemu, który uczy się z poprzednich błędów. Kiedy model nie spełni konkretnego warunku, techniki weryfikacji okazane skuteczne w ujawnieniu tego problemu mogą zostać zintegrowane w przyszłe ewaluacje. To podejście pozwala benchmarkom ewoluować i lepiej łapać coraz bardziej zaawansowane modele, zamiast pozostać statycznymi testami.