Naukowcy opracowali framework Calibrated User Embeddings (CUE), który rozwiązuje fundamentalny problem oceny agentów AI - istniejące symulatory użytkowników nie odzwierciedlają rzeczywistych wzorów awarii ludzi. Podczas gdy obecne podejścia dobrze naśladują styl i zachowanie, brakuje im align-owania tego, kiedy i jak agenci rzeczywiście zawodzą w interakcjach z rzeczywistymi ludźmi.
Metoda CUE działa w trzech krokach: najpierw koduje obserwowane sesje użytkowników w embeddingi, następnie próbkuje z nich ciągłe reprezentacje, a na koniec dekoduje je na komendy persona, które sterują dużymi modelami językowymi do roli symulator-a użytkownika. Kluczową zaletą jest brak potrzeby treninguje - system działa bezpośrednio z istniejącymi modelami. Na benchmarku tau-squared-Bench symulatory CUE wykazały mniejszą liczbę błędów przypisywanych samym symulatorom i dokładniej reprodukowały rzeczywiste wzory niepowodzenia, wskaźniki sukcesu oraz wyniki dla konkretnych par zadanie-użytkownik niż inne metody persona-based.
Co szczególnie ważne, podejście wykazuje zdolność generalizacji - po treningu głównie na interakcjach wsparcia klienta, te same symulatory CUE pozostają efektywne w tworzeniu dokumentów, korepetycjach z matematyki i rozmowach casual, oraz działają poprawnie z różnymi modelami LLM bez potrzeby retreningu CUE. To wskazuje na potencjał benchmarkingu wieloturowego, który bardziej wiernie odtwarza rzeczywiste doświadczenia użytkowników.