Nowe badanie ujawnia, że architektura modelu transformera w bezpośredni sposób determinuje, jak dobrze potrafimy obserwować i interpretować jego wewnętrzne procesy. To odkrycie zmienia dotychczasowe podejście do badania przejrzystości dużych modeli językowych.
Naukowcy przeanalizowali, w jaki sposób struktura sieci - od liczby warstw, przez rozpiętość attention heads, po sposoby projektowania połączeń między składnikami - wpływa na to, czy jesteśmy w stanie zrozumieć, co faktycznie robi model w danym momencie obliczeniowym. Okazuje się, że niektóre wybory architektoniczne naturalnie ułatwiają obserwowalność, podczas gdy inne ją utrudniają. Badanie sugeruje, że decyzje projektantów modeli mogą mieć znacznie większy wpływ na interpretowalność niż dotychczas sądzono - więcej niż sama wielkość modelu czy ilość danych treningowych.
To ma daleko idące konsekwencje dla bezpieczeństwa AI i zaufania do systemów opartych na transformerach. Jeśli chcemy budować bardziej przejrzyste i kontrolowalne modele, nie wystarczy je tylko testować - trzeba myśleć o przejrzystości już na etapie projektowania architektury. Wyniki mogą wpłynąć na to, jak producenci największych modeli podchodzą do przyszłych wersji swoich systemów, zmuszając ich do rozważenia kompromisów między wydajnością a możliwością obserwacji działania modelu.