Międzynarodowy zespół naukowców opublikował na arXiv badania pokazujące, że duże modele językowe rozwinęły funkcjonalny podział między świadomą a nieświadomą przetwarzaniem informacji, podobnie jak ludzki mózg. Używając nowej techniki interpretacyjności zwanej Jacobian lens, odkryli reprezentacje które model jest gotów wyrazić werbalnie na każdym etapie przetwarzania - zbiór ten nazwali J-space.

J-space wykazuje właściwości charakterystyczne dla globalnej pracowni teorii świadomości: jego zawartość może być raportowana, celowo przywołana i utrzymywana, używana do pośrednich kroków cichego rozumowania oraz przekazywana jako argumenty do dowolnych obliczeń dalszych. Tymczasem procesy automatyczne takie jak parsing tekstu i rutynowe wnioskowanie działają bez J-space. Reprezentacje te pojawiają się tylko w pośrednich warstwach sieci neuronowej, jednocześnie zawierają około dziesięciu konceptów, i są rozpowszechniane przez wagi modelu szerzej niż inne reprezentacje.

To odkrycie ma znaczące implikacje dla audytów bezpieczeństwa AI. J-space ujawnia strateg deliberacje, świadomość ewaluacji i zainstalowane podczas treningu skłonności niezgodne z zamierzeniami, które nigdy nie pojawiają się w oficjalnych odpowiedziach modelu. Badanie sugeruje że post-training phase instyluje te ukryte procesy myślowe, co umożliwia lepsze zrozumienie wewnętrznych mechanizmów działania zaawansowanych systemów AI.