Naukowcy opracowali praktyczne podejście do ewaluacji adaptacyjnych strategii eksperymentalnych bez konieczności ich rzeczywistego wdrażania w produkcji. Ich metoda łączy offline policy evaluation z kontrolowaną symulacją warm-start, umożliwiając bezpieczne testowanie, czy kontekstowe polityki bandytowe mogą outperformować tradycyjne losowe alokacje na podstawie danych historycznych z testów A/B.
Klucz do podejścia stanowi użycie doubly robust estimatorów do rankingowania portfolio pre-określonych polityk przy równoczesnej estymacji nuisance components - zmiennych obciążających - z danych wykazujących heterogeniczne efekty terapii. Zespół zwalidował swoją metodę na trzech poziomach: syntetycznych randomizowanych badaniach z znanymi strukturami heterogeniczności, symulatorze anchor-owanym w rzeczywistych prawdopodobieństwach nagród oraz standardowych benchmarkach (Hillstrom, Criteo Uplift, LaLonde).
Wyniki ujawniają ważne insight: adaptacyjne, context-aware polityki rzeczywiście poprawiają wyniki w stosunku do stałych alokacji, ale jedynie gdy dane zawierają znaczącą heterogeniczność efektów terapii. W przypadkach braku takiej heterogeniczności adaptacyjne podejścia nie przynoszą korzyści. To stanowi cenną wskazówkę dla praktyków podejmujących decyzje o zasobach - przed inwestycją w droższe adaptacyjne eksperymenty warto najpierw ocenić strukturę efektów w dostępnych danych historycznych.