Zespół badawczy odkrył, że mniej niż 1% z 9216 wymiarów ukrytego stanu klastracyjnego w BERT-base-uncased jest krytycznych dla wykrywania AI-generowanych tekstów, przy czym liczba ta pozostaje spójna dla różnych generatorów AI. Używając protokołu sparse-probing L1-to-L2 na benchmarku RAID, badacze wyodrębnili stabilne zbiory neuronów, które mogą przewidzieć pochodzenie tekstu prawie tak dobrze jak model wykorzystujący wszystkie neurony.
Ważne jest, że bidirectional activation patching - technika polegająca na zmianie aktywacji neuronów - potwierdziła przyczynowy wpływ tych neuronów. Manipulacja wyidentyfikowanymi neuronami zmieniała prognozy około 10 razy częściej niż zmiany w losowych zbiorach o podobnym rozmiarze. Jednocześnie średnie ablowanie (usunięcie) tych neuronów nie drastycznie nie obniżało dokładności, sugerując że sygnał jest rozprowadzony redundantnie - wiele neuronów przenosi tę samą informację.
Analiza porównawcza ujawniła fascinującą strukturę: modele poddane fine-tuningowi instrukcji skoncentrowały 30-36% stabilnych neuronów w ostatniej warstwie BERT-a (warstwa 12), podczas gdy czyste modele bazowe wykazały poniżej 14%, co sugeruje ślad wyrównania z post-treningiem. Testy leave-one-family-out pokazały, że wybrane neurony zachowywały 86-94% wydajności na wcześniej niewidzianych rodzinach generatorów, wskazując że detektor może pracować na małej, stałej podprzestrzeni bez potrzeby ponownego identyfikowania neuronów dla każdego nowego generatora.