Naukowcy opracowali TWIST, kompleksowy benchmark mający oceniać jakość interwencji w systemach pamięci konwersacyjnej, czyli umiejętność prawidłowego reagowania na momenty zmian przekonań użytkownika. W przeciwieństwie do istniejących testów skupiających się na recall i aktualizacjach wiedzy, TWIST bada cztery kluczowe aspekty: niezapytane wykrywanie napięcia, weryfikację wychodzących propozycji tekstu, odpowiadanie z aktualnych przekonań przy zachowaniu historii zmian oraz kontrolę dostępu do wrażliwych informacji. Benchmark rozszerza wcześniejsze korpusy LoCoMo i zawiera inteligentnie dobrane negatywne przykłady - na każdą metrykę detekcji przypada kontrola przed nadmiernym flagowaniem, co uniemożliwia manipulację wyników poprzez oznaczanie wszystkiego jako problemowe.

Walidacja benchmarku była rygorystyczna: niezależna, ślepa dwukrotna adnotacja z arbitrażem, kalibracja sędziów i audyt separowalności. Na Track B v1.0 (161 elementów po arbitrażu, kappa = 0,85) żadna testowana konfiguracja nie osiąga jednocześnie wysokiego recall sprzeczności, wysokiej specyficzności na trudnych negatywach i wysokiej atrybucji. Płaskie systemy RAG zawierają 76-97% rzeczywistych sprzeczności, ale błędnie flagują 16-43% powierzchniowo pasujących bezpiecznych tekstów w zależności od silnika, podczas gdy wdrożony system zorientowany na spójność niemal nigdy nie flaguje błędnie (0,98-1,00 specyficzności), ale wykrywa tylko 42% rzeczywistych sprzeczności.

Wyniki ujawniają fundamentalny trade-off w systemach pamięci konwersacyjnej: trudno jednocześnie uniknąć fałszywych alarmów i nie przegapić rzeczywistych problemów. TWIST stanowi narzędzie do bardziej dokładnego mierzenia tego kompromisu, a jego struktura z kontrolami przeciwko overtestingowi powinna zapobiec zbytnim optymalizacjom na papierze. Benchmark jest szczególnie ważny dla aplikacji wymagających wysokiej stawki, gdzie zarówno ignorowanie istotnych zmian w przekonaniach, jak i niepotrzebne interwencje mogą prowadzić do poważnych problemów.