Zespół badaczy opracował algorytm Robust Async-Fed-Q rozwiązujący problem federacyjnego reinforcement learning'u w obecności adversarialnych agentów. W tym scenariuszu wiele agentów interaguje ze wspólnym procesem decyzyjnym Markova, wymieniając się informacjami poprzez serwer centralny, aby wspólnie nauczyć się optymalnej polityki - ale niektórzy agenci świadomie wysyłają skorumpowane dane.
Klucz do podejścia stanowi kombinacja dwóch mechanizmów: na poziomie agentów stosuje się wariancyjnie zmniejszoną estymację operatora Bellmana, a na serwerze centralnym wdrażana jest odporna agregacja, która minimalizuje wpływ danych od złośliwych uczestników. Autorzy wykazali matematycznie, że metoda zachowuje korzyści współpracy między uczciwymi agentami - im więcej danych zgromadzą, tym mniejszy staje się wpływ zatruwających informacji, aż ostatecznie zanika w granicy nieskończonych próbek.
Pracę wyróżnia dostarczenie teoretycznych gwarancji skończonego czasu wraz z informacyjno-teoretycznymi dolnymi granicami dla problemu adversarialnie odpornego federacyjnego reinforcement learning'u - to pierwsze prawie pasujące górne i dolne oszacowania dla tego zagadnienia. Autorzy dodatkowo rozszerzyli framework na pojedyncze trajektorie i heterogeniczną eksplorację, gdzie różni agenci mogą uczestniczyć nierównie w zbieraniu danych.