Zespół badawczy zaproponował nową zasadę bezpieczeństwa dla systemów Retrieval-Augmented Generation (RAG), która stanowi alternatywę dla dotychczasowego podejścia Cordon Principle. Zamiast całkowitej izolacji dostępu do surowych dokumentów, proponują permitowanie dostępu tylko modelom wyposażonym w zdolności do System 2 thinking - głębokich, deliberatywnych rozumowań.
Problem, którym się zajmują, dotyczy podatności systemów RAG na ataki knowledge-poisoning, w których zmienione lub fałszywe informacje w pobieranych dokumentach mogą wpłynąć na finalną odpowiedź modelu. Kluczowa obserwacja: model może poprawnie wykryć, że dokument zawiera błędne informacje, ale jednocześnie być przez nie wpływany. Poprzednie rozwiązanie Cordon Principle całkowicie blokowało modelom dostęp do surowych źródeł, co jednak generowało znaczące koszty obliczeniowe.
Badacze wprowadzili nowe metryki do kwantyfikacji rozdzielenia między detektowaniem dezinformacji a jej rzeczywistym wpływem na wyjście. Empiryczne testy wykazały, że nowoczesne modele zdolne do zaawansowanych rozumowań wykazują znacznie większą odporność na skorumpowane dowody niż standardowe LLM-y, bez konieczności stosowania rygorystycznej izolacji. Te wyniki sugerują praktyczniejszą i bardziej efektywną podstawę do projektowania bezpiecznych systemów RAG.