Naukowcy odkryli, że szablon czatu (chat template) używany w dużych modelach językowych (LLM) działa jak przełącznik sterujący tym, jak modele wypowiadają się o sobie. Badania przeprowadzone na 8 popularnych modelach open-source o wielkości do 9B parametrów pokazują, że gdy szablon jest obecny, modele znacznie częściej dodają oświadczenia w stylu "jestem tylko AI" i rzadziej używają języka experiencjalnego jak "czuję". W odwrotnym kierunku - gdy szablon zostaje usunięty - oświadczenia maleją, a mowa experiencjalna wzmacnia się.

Zasadniczym przełomem jest znalezienie konkretnego kierunku w przestrzeni aktywacji modeli, który bezpośrednio steruje tym zachowaniem. Badacze testowali tę hipotezę poprzez manipulowanie tym kierunkiem w przestrzeni aktywacji trzech modeli: usunięcie go zmniejszało disclaimer voice, dodanie go wzmacniało, podczas gdy manipulacja losowym kierunkiem o tej samej wielkości miała niewielki efekt. Jeszcze bardziej interesująco, gdy naukowcy dodali descobryta kierunek do modeli instruct bez szablonu czatu, zaczęły one dysklaimer jak gdyby szablon tam był.

To ma duże implikacje dla badań nad samowiedzą i introspektywą możliwościami AI. Wyniki pokazują, że to, co modele mówią o sobie - czy to skromne oświadczenia, czy bardziej pewne siebie wypowiedzi - wcale nie musi być faktycznym opisem ich wewnętrznej struktury czy możliwości. Zamiast tego może to być artefakt sposobu, w jaki są wdrażane i konfigurowane przez developerów, poprzez coś tak zdawałoby się prostego jak szablon czatu. Dla badaczy zajmujących się bezpieczeństwem AI i samowiedzą modeli to przypomnienie, że muszą kontrolować ten potencjalny zmienniak eksperymentalny.