Naukowcy z arXiv zaproponowali nowy framework bezpieczeństwa dla systemów dialogowych LLM, który zmienia paradygmat oceny ryzyka z pojedynczych wymian na całą sesję rozmowy. Dotychczas guardrails oceniały każdą parę prompt-odpowiedź w izolacji, pomijając niebezpieczeństwa, które pojawiają się dopiero w kontekście wieloturowych rozmów, gdzie łagodne zwroty powoli akumulują się w poważne problemy.

Team wprowadził koncepcję Conversational Risk Accumulation (CRA), która obejmuje trzy główne zagrożenia: stopniowy drift intencji użytkownika od początkowego punktu rozmowy, fragmentaryczne montowanie zakazanych instrukcji i rosnącą gotowość do współpracy po powtarzanych ujawnieniach wrażliwych informacji. Framework śledzi te zagrożenia poprzez trzy sygnały trajektorii - semantyczny drift od zakotwiczenia sesji, graf akumulacji informacji ważonej wrażliwością oraz sygnał compliance-gradient pokazujący zwiększającą się gotowość do wykonania poleceń.

Do ewaluacji zaproponowano dwa podejścia: nienadzorowaną fuzję convex dla atrybuucji oraz CRA-Net DA, kompaktny nauczony model trajektorii trenowany z family-adversarial objectives. Zespół wydał trzy wersje benchmarku CRA-Bench zawierające łącznie 2000 sesji rozmowy z trzema do pięciu różnymi rodzinami zagrożeń, w tym warianty parafrazowane przez LLM i rozszerzone scenariusze z priming personą i context stuffingiem. Nowy protokół ewaluacji uwzględnia splits na poziomie sesji i metryki natywne dla trajektorii, co znacząco zmienia sposób mierzenia bezpieczeństwa systemów conversacyjnych.