Naukowcy z arXiv zaprezentowali metody neutralizacji stronniczości politycznej w dużych modelach językowych podczas fazy wnioskowania, bez potrzeby przeucczania modelu. Problem dotyczy podatności współczesnych LLM na prompt injection, które mogą zmuszać modele do generowania tendencyjnych streszczań pomimo zastosowania alignment technik takich jak RLHF.

Team testował modele na publicznym zbiorze nagrań sesji legislacyjnych, wstrzykując stronniczość poprzez adversarial prompting i oceniając wyniki w czterowymiarowej skali dla podsumowań politycznych. Zaproponowana metoda Recursive Self-Correction łączy Chain of Thought prompting z Direct Preference Optimization, aby model sam korigował wprowadzaną tendencyjność na etapie generowania odpowiedzi. Średnia skala neutralności politycznej wzrosła z bazowej 2,14 do 4,56 dla wszystkich testowanych modeli.

To podejście jest istotne dla wiarygodności LLM w aplikacjach krytycznych, szczególnie w streszczaniu informacji legislacyjnych czy newsów. Zamiast odbudowywać całe modele, inference-time mitigation pozwala na szybką adaptację istniejących systemów do nowych zagrożeń i przekonań użytkowników bez zmniejszania wydajności ogólnej.