Naukowcy z MIT i Google opracowali TRACER, zaawansowany symulator użytkownika zdolny do modelowania ewolucji intencji w trakcie wieloturowych rozmów. W przeciwieństwie do poprzednich podejść, które skupiały się na naturalności pojedynczych odpowiedzi, TRACER uczy się odwzorowywania całych trajektorii interakcji rzeczywistych użytkowników, śledząc jak zmienia się ich cel i jak osiągają konkretne wyniki.

Model został wytrenowany dwuetapowo: najpierw na rzeczywistych dialogach użytkowników poprzez supervised fine-tuning, następnie przy użyciu reinforcement learning Multi-turn RL łączy hierarchiczne nagrody na poziomie wyniku i trajektorii z modułacją przewagi świadomą odchyleń. To podejście elegancko rozwiązuje dwa kluczowe problemy - rzadkość nagród w długich dialogach i przydzielanie kredytu dla poszczególnych akcji. TRACER-7B surpasuje mocne linie bazowe o 11,4 punktu w F1 konwersji, osiąga najmniejsze błędy konwersji na poziomie grupy i wykazuje dobrą generalizację na dane spoza rozkładu treningowego.

Ważne jest, że w testach Turinga ludzie mieli trudności z rozróżnieniem rozmów wygenerowanych przez TRACER od rzeczywistych - dokładność identyfikacji była bliska przypadkowości 50 proc. Badacze wprowadzili również Dynamic Marketing Benchmark, nowy system ewaluacji który ujawnia ważny wgląd: wyższa jakość odpowiedzi LLM nie zawsze koreluje z wyższymi wskaźnikami konwersji. To sugeruje że perswazja to bardziej subtelnka sztuka niż sama jakość tekstu, a symulatory takie jak TRACER otwierają nowe możliwości badania tych dynamik na dużą skalę.