Badacze mechanistycznej interpretowalności modeli Llama-3 odkryli, że neurony odpowiedzialne za operacje arytmetyczne są form-invariant - działają konsystentnie niezależnie od tego, czy rozwiązują symbolicznie zapisane problemy, słowne zadania matematyczne czy kod Python. Zespół zidentyfikował te neurony za pomocą dwuetapowego procesu łączącego attribution patching i activation patching.

Znaleziono kompaktowy zbiór neuronów wspólny dla wszystkich trzech formatów, który okazał się zarówno konieczny, jak i wystarczający dla późnych warstw obliczeń arytmetycznych. To stanowi przełom w rozumieniu, dlaczego modele mogą działać doskonale na jednym sformułowaniu problemu, a zawodzić na równoważnym - niekoniecznie dlatego, że posiadają różne wewnętrzne obwody, ale dlatego, że te same neurony są w innym stanie aktywacji.

Najdramatyczniejszym odkryciem było, że transferowanie aktywacji wspólnych neuronów ze skutecznej egzekucji w jednym formacie do błędnej egzekucji w innym odzyskiwało ponad 97 procent błędnych predykcji dla dodawania i odejmowania. Ponadto wspólne neurony konsystentnie należały do tych samych rodzin heurystyk niezależnie od formatu, co potwierdza, że obliczenia arytmetyczne w LLM-ach są w dużej mierze form-invariant na poziomie neuronowym.