Naukowcy z arXiv opracowali nowy protokół do oceny, czy agent powinien zaakceptować aktualizację swojej polityki działania bez ryzyka zapomnienia poprzednio wyuczonych umiejętności. Problem ten dotyczy robotów i systemów AI działających w świecie rzeczywistym, które muszą się kontinualnie uczyć nowych zadań, jednocześnie zachowując zdolności do wykonywania starych zadań.
Kluczową obserwacją badaczy jest to, że tradycyjne walidacyjne bramy pewności - oparte na zakresach wartości - nie potrafią certyfikować, że zachowanie na starych zadaniach pozostanie niezmienione w ramach danego budżetu interakcji. Zamiast tego zaproponowali parowaną konstrukcję binarną, która znacznie lepiej radzi sobie w sytuacjach, gdzie niezgodności wyników są rzadkie. Nowa metoda zaakceptowała 31,6% wspólnego strumienia aktualizacji przy 2000 epizodów na etapie, podczas gdy metoda tradycyjna zaakceptowała dokładnie zero.
Badania obejmowały testy diagnostyczne na modelowanym robota oraz testy odporności z zarabiającą dynamiką, które pozwalają rozróżnić błąd modelu od błędu selekcji sprzężenia zwrotnego. Autorzy wskazują, że walidacja pozostaje otwartym problemem dla rzeczywistych robotów i dużych modeli wizjo-jezykowych (VLA), ale ich protokół do audytu stanowi ważny krok w kierunku bezpiecznego uczenia się agentów.