Naukowcy z arXiv opracowali nową procedurę do odkrywania ukrytych wymiarów stylów w dużych modelach językowych, która nie wymaga żadnych danych treningowych. Zamiast tego metoda opiera się na wielokrotnym próbkowaniu odpowiedzi na identyczny prompt z podniesioną temperaturą, a następnie zastosowaniu Analizy Głównych Składowych (PCA) do zgromadzonych ukrytych stanów modelu. Wynikające osie są automatycznie oznaczane na podstawie generowanych odpowiedzi.
Walидацja przeprowadzona na 245 adnotacjach stylistycznych dostarczonych przez ludzi pokazała imponujące wyniki dla modelu Qwen-3.5-4B-Instruct: dwie główne osie uchwytują wymiary spontanicznie żądane przez ludzi z precyzją 72,8%, a 75,6% ocen słuszności stwierdziło, że generacje biegunowe osi dokładnie odpowiadają ich etykietom. Metoda wykazała jednak znaczące różnice między modelami - zarówno warianty Qwen jak i Llama-3.2-3B ujawniały osie ważne dla ludzi, podczas gdy DeepSeek-7B-Chat spadł do zaledwie 35,3% precyzji, z dominującą wariancją strukturalną zamiast stylistycznej.
Badanie podkreśla, że prosta analiza PCA nad wariancją dekodowania modelu jest efektywnym i tanim sposobem na badanie struktury stylistycznej w reprezentacjach modeli, jednocześnie ujawniając znaczące różnice między modelami w organizacji tej struktury. To może mieć praktyczne znaczenie dla lepszego zrozumienia i potencjalnego sterowania stylami w generowanych tekstach bez konieczności gromadzenia drogich danych treningowych.