Naukowcy opracowali nową architekturę do moderacji treści multimedialnych, która rozdziela rozumienie zawartości od oceny naruszeń polityki. Architektura SJR składa się z dwóch odrębnych modeli połączonych interfejsem tekstowym: first model generuje ustrukturyzowane podsumowania zawartości multimedialnej, a drugi model ocenia je względem zdefiniowanych reguł moderacyjnych.
Tradycyjne systemy moderacji wymagają całkowitego przeszkolenia przy każdej zmianie polityki, a dodatkowo cierpią na brak wystarczających danych treningowych, ponieważ treści multimedialne nie mogą być w znaczący sposób augmentowane. Nowe podejście rozwiązuje ten problem dzięki możliwości augmentacji w przestrzeni tekstu - można generować wariacje podsumowań wprowadzające różne scenariusze naruszenia polityki. Iteracyjna pętla współtrenowania dodatkowo doskonali Content Model za pomocą GRPO, aby generował podsumowania istotne dla konkretnych reguł moderacyjnych.
Na praktycznym zadaniu detekcji zwodniczych reklam system SJR uzyskał 23,6 procent wzrost wyniku F1 dla klasy "non-misleading" w porównaniu z baseline chain-of-thought, przewyższając zaawansowane metody takie jak STaR czy RLFT. Szczególnie imponujący jest fakt, że wariant trenowany wyłącznie na syntetycznie wygenerowanych danych naruszających politykę osiągnął wydajność zaledwie 0,2 procent gorszą od modelu trenowanego na pełnym zbiorze danych zawierającym realne naruszenia. To oznacza, że nowe polityki moderacyjne mogą być wdrażane bez żadnych rzeczywistych przykładów naruszeń. Dodatkowo każda decyzja jest uzasadniona czytelnym dla człowieka podsumowaniem, co zapewnia interpretowność systemu jako naturalny efekt uboczny architekturze.