Badania opublikowane na arXiv pokazują, że lokalizowanie ukrytych struktur w aktywacjach modeli językowych to tylko pierwszy krok - znacznie ważniejsze jest zrozumienie, dlaczego niektóre z nich faktycznie wpływają na zachowanie systemu. Naukowcy rozłożyli problem kauzalnego wpływu na trzy niezależne czynniki: pojemność mierzącą wrażliwość wyjścia modelu na ruchy wzdłuż struktury, responsywność pokazującą jak promowalna jest koncepja w danym kontekście oraz alignment opisujący zgodność struktury z reprezentacją koncepcji.
Testy na 4 rodzinach modeli językowych i 50 różnych koncepcjach ujawniły, że wszystkie trzy czynniki muszą mieć wysokie wartości jednocześnie. Niska pojemność zmniejszała efektywność o 84 procent, niska responsywność aż o 95 procent, a zła wyrównanie mogła całkowicie odwrócić efekt i zamiast aktywować koncepcję, ją tłumiła. Kluczowym odkryciem było to, że przyczynowość nie jest wewnętrzną właściwością struktury, lecz zależy od kontekstu - efektywne kierunki kauzalne tworzą niskowymiarową podprzestrzeń, która zmienia się między kontekstami.
Autorzy wykorzystali to odkrycie, aby wprowadzić ulepszone przyczynowe probes - narzędzia treningowe ograniczone do tej specjalnej podprzestrzeni. Osiągnęły one od 17 do 118 procent poprawy w sterowaniu modelami, przy jedynie 3 procentowej stracie w zdolności detekcji koncepcji. To ma znaczenie dla bardziej precyzyjnego kontrolowania zachowania dużych modeli językowych.