Badacze pracujący nad cyfrowymi bliźniakami opartymi na modelach LLM wykazali, że sposób organizacji informacji o osobowości jest ważniejszy niż sama ilość danych. Zamiast polegać na surowych transkryptach lub zwykłych streszczeniach generowanych przez modele, zespół porównał podejścia bez struktury ze skoncentrowanymi reprezentacjami persona i wykazał wyraźne korzyści płynące z właściwej organizacji danych.
Pierwsze eksperymentu wykorzystały ręcznie opracowany schemat BDE - rozwinięcie trzech kluczowych aspektów: Background (tło osobiste), Decision procedure (proces decyzyjny) oraz Evaluation (ocena). Ten struktur, zakorzeniony w teorii zachowań konsumenckich, poprawił dokładność predykcji o 1,91 punktu procentowego w stosunku do surowych transkryptów na benchmarku Twin-2K-500. Wyniki były spójne też na innych modelach takich jak gpt-4-mini i Qwen3-8B, co potwierdza solidność podejścia.
Jednak sztywny schemat BDE nie sprawdzał się przy bardziej zróżnicowanych zadaniach, gdzie wydajność była nieodróżnialna od prostego baseline'u. Odpowiedzią na ten problem stał się automatyczny pipeline odkrywania struktur, w którym model LLM iteracyjnie proponuje i udoskonala struktury persona oraz prompty ekstrakcji specyficzne dla danego zadania. Podejście to testowane na 13 zróżnicowanych benchmarkach wskazuje na potencjał adaptacyjnych rozwiązań, które mogą się dostosowywać do konkretnych wymagań aplikacji zamiast stosować uniwersalne reguły.