Naukowcy postanowili sprawdzić, czy modele transformatorów naprawdę rozumieją struktury grafów, czy tylko naśladują uczenia się poprzez liczące się numeryczne wzorce. Badanie opublikowane na arXiv wykorzystało techniki analizy kauzalnej, aby zaglądnąć do wnętrza sieci neuronowych i zrozumieć, co faktycznie dzieje się, gdy model uczy się relacji między węzłami w grafe. To ważne pytanie, bo jeśli sztuczna inteligencja operuje jedynie na poziomie powierzchniowych obwodów matematycznych, bez głębokich konceptualnych modeli, to jej możliwości mogą być bardziej ograniczone niż sądzimy - zwłaszcza w zadaniach wymagających elastycznego rozumowania na temat skomplikowanych struktur.
Zespół badawczy skoncentrował się na transformatorach działających w locie, czyli takich, które dostosowują się i uczą się podczas rzeczywistego przetwarzania danych. Odkryli empiryczne dowody sugerujące, że modele rzeczywiście budują wewnętrzne reprezentacje struktur grafowych, a nie tylko uczą się sztuczek obliczeniowych. Wyniki wskazują na konkretne mechanizmy neuronowe odpowiadające za to uczenie się, otwierając nową perspektywę na to, jak transformatory przetwarzają informacje strukturalne zawarte w danych.
Implikacje badania sięgają daleko poza czystą naukę. Zrozumienie, w jaki sposób modele AI naprawdę przyswajają wiedzę o relacjach i strukturach, może prowadzić do bardziej efektywnych metod treningu i projektowania architektur sieciowych. To wiedza przydatna dla każdego, kto pracuje nad poprawianiem zdolności AI do pracy z danymi złożonymi i strukturyzowanymi - od rekomendacji w sieciach społecznych po analizę biologicznych sieci białkowych.