Google Research opublikował kompleksowy poradnik dotyczący RRSI, metody umożliwiającej agentom LLM samodoskonalenie się poprzez przepisywanie własnych komponentów bez koniecności retrainingu modelu podstawowego. Zamiast modyfikować zamrożony model, RRSI pozwala na ewolucję promptów, narzędzi, systemu pamięci, kontroli przepływu i nawet podagentów, przy zachowaniu ostrożności przed overfittingiem.
Połądnik skupia się na kluczowej części metody - zbiorze reguł decyzyjnych wybierających, które proponowane edycje zachować. Te reguły zaimplementowano w czystym Pythonie, co czyni je dostępnymi bez specjalistycznego sprzętu. Pełny cykl RRSI wymaga mocniejszych zasobów (Claude Opus na Vertex AI, Docker benchmarki), ale edukacyjna część może działać lokalnie. Poradnik przeprowadza przez estymator modelu, kalibrowaną wstęgę szumu, oba warianty algorytmu selekcji, annealed edit budget, ekran detekcji nieszczelności oraz historię edycji.
Znaczenie podejścia tkwi w możliwości audytu decyzji algorytmu względem rzeczywistych efektów edycji - zespół zbudował symulowane środowisko, gdzie każda zmiana ma mierzalny wpływ. Pozwala to porównać RRSI z prostszym przeszukiwaniem unregularyzowanym, które zachowuje tylko najwyższe wyniki. To istotny krok w rozwoju agentów zdolnych do autonomicznego doskonalenia się bez konieczności petrainingu czy fine-tuningu całego modelu.