Liniowe sondy mogą być używane do wykrywania zachowań i koncepcji w aktywacjach modeli językowych, ale zwykle źle się transferują do przykładów z innego rozkładu danych. Badacze z arXiv testowali sondy modelu Llama-3.1-8B-Instruct do wykrywania oszustw na trzech nieznanym modelowi zbiorach testowych i odkryli eleganckie rozwiązanie: projekcja wejść na mały podzbiór składowych głównych z rozkładu treningowego aktywacji umożliwia transfer między domenami z wydajnością zbliżoną do sond wytrenowanych bezpośrednio na danych testowych.

Klucz do tego podejścia stanowiła automatyczna selekcja transferowalnych kierunków. Naukowcy zastosowali судьę LLM do oceny każdej składowej głównej na podstawie tego czy przykłady z najwyższą i najniższą aktywacją sugerują przenośny kierunek oszustwa. Po wyborze składowych z najwyższą oceną i użyciu ich do tworzenia sondy uzyskali znaczące улучшення: zmniejszenie luki między wynikami bazowymi a optymalnymi o 78 procent w zbiorze Insider Trading Report i o 25 procent w zbiorze Sandbagging.

Wniosek z badania jest szeroki: sondy w oryginalnym rozkładzie ważą kierunki kodujące cechy specyficzne dla źródła, podczas gdy kierunki które faktycznie się transferują kodują tę samą kontrast bardziej abstrakcyjnie w sposób który można opisać językiem naturalnym. To sugeruje że odporność sond poza rozkładem jest w dużej mierze wyznaczona przez wybór podprzestrzeni. Odkrycie ma znaczenie dla budowania bardziej niezawodnych systemów wykrywających oszustwa i innych zachowań w modelach, których działanie powinno być konsystentne bez względu na charakterystykę danych wejściowych.