Naukowcy z arXiv zaprezentowali Latent Diagnostic Taxonomy, framework łączący dwie funkcje: budowanie klasyfikatorów bezpieczeństwa do wykrywania prompt injection i tworzenie diagnostyki pomagającej ocenić wiarygodność ich decyzji. Główną innowacją jest połączenie optymalizacji wymiarów embeddingu z identyfikacją tzw. latent support vectors - około 29 procent przykładów treningowych - reprezentujących kluczowe prompty do zidentyfikowania tokenów zmieniających przewidywania modelu.
Framework działalności opiera się na trzystopniowym procesie. Najpierw system buduje klasyfikator z wymiarami embedingu wybranymi empirycznie przez walidację krzyżową zamiast założeń a priori. Następnie lokalizuje małą grupę krytycznych wektorów wspierających modelujących wpływ tokenów na decyzje. Wreszcie konstruuje taksonomię diagnostyczną umożliwiającą routowanie promptów do czterech kategorii: Safe (bezpieczne do akceptacji), Heuristic Bias (z systematycznym odchyleniem), Heuristic Override (wymuszające interwencję człowieka) i Insufficient Context (wymagające dalszej analizy).
Badania na publicznym datasecie prompt injection ujawniły znaczący problem: aż 77 procent decyzji, które klasyfikator wydaje z wysoką pewnością, nie jest robustnych wobec usunięcia pojedynczego tokenu. Naukowcy zidentyfikowali dwa główne wzorce awarii - błąd kalibracji zaufania klasyfikatora oraz rzeczywistą exploitable shortcut umożliwiającą obejście systemu. Dla każdej strefy taksonomii framework proponuje konkretne strategie naprawy, co czyni go praktycznym narzędziem dla developersów pracujących nad bezpieczeństwem systemów AI wrażliwych na ataki prompt injection.