Naukowcy z arXiv opublikowali nowe podejście do benchmarkowania zdolności personalizacji w dużych modelach języka. Zamiast mierzyć adaptację wobec tego samego użytkownika, któremu model służy, skupili się na pytaniu czy spersonalizowana wiadomość faktycznie skłania trzecią stronę do podjęcia zamierzonego działania.

Team opracował SDR-Bench - zbiór danych obejmujący 6279 historii sukcesu klientów z 22 branż i około 200 przedsiębiorstw. Benchmark wykorzystuje symulację z ograniczeniami czasowymi, która zapobiega wyciekom danych z przyszłości. Badacze zaadaptowali do tego celu framework Bayesian Persuasion Kameniki i Gentzowa z 2011 roku, przystosowując go do agentów generacyjnych w kontekście sprzedaży, gdzie działania odbiorców są systematycznie rejestrowane względem wiadomości, które je wywołały.

Testując frontier LLM-y i zaawansowane modele badawcze, naukowcy obserwują konsystentny plateau w wydajności personalizacji. To odkrycie jest istotne dla ekosystemu AI, ponieważ ujawnia obecne ograniczenia najbardziej zaawansowanych modeli w zadaniach wymagających głębokiego zrozumienia i adaptacji do konkretnych odbiorców. Wyniki mogą kierować przyszłe prace nad ulepszoną personalizacją i mają praktyczne implikacje dla zastosowań komercyjnych, gdzie skuteczna personalizacja bezpośrednio wpływa na konwersje.