Naukowcy opracowali nowy system Statutory AI, który wykorzystuje rzeczywiste teksty prawne jako ramę konstytucyjną do kierowania zachowaniem dużych modeli językowych. Zamiast polegać na ogólnych zasadach etycznych lub wymagać ciągłego nadzoru człowieka, system automatycznie analizuje zapytania użytkownika i porównuje je z odpowiednimi artykułami z corpus legislacyjnego, aby zapewnić zgodność z normami prawnymi.

Metoda opiera się na dwustopniowym procesie. Najpierw system klasyfikuje użytkownika zapytanie do jednej z zidentyfikowanych kategorii tematycznych dotyczących prawa. Następnie analizuje to zapytanie w połączeniu z istotnymi artykułami wybranymi z prawnego corpus tej kategorii, stosując technikę Chain-of-Thought prompting do głębszej analizy. Badacze przetestowali podejście na 1000 próbach ataku (red-teaming) obejmujących pięć kategorii zagrożeń: dyskryminacja, ujawnianie poufnych informacji, przemoc, oszustwa i wykorzystywanie osób podatnych.

Wyniki są zachęcające - Statutory AI osiągnął redukcję szkodliwej zawartości na poziomie 52-59 procent. To znaczące udoskonalenie w stosunku do obecnych metod alignment, takich jak Constitutional AI, które wymuszają ciągły nadzór człowieka. Nowe podejście ma potencjał do automatycznego egzekwowania wymogów regulacyjnych bez konieczności aktualizacji systemu za każdym razem, gdy zmienia się prawo.