Naukowcy z arXiv opublikowali pracę pokazującą fundamentalne ograniczenie czystych Transformerów w uczeniu się generalizacji strukturalnej. Przełomem jest pierwsza formalna matematyczna definicja tego, co oznacza generalizacja strukturalna - zdolność do zrozumienia nowych, niewidocznych wcześniej kombinacji poznanych elementów, jak człowiek konstruujący nowe zdania z znanych słów.

Autorzy udowadniają, że problem sprowadza się do NC1-zupełnego zadania ewaluacji drzew semantycznych (BFVP). Czyste Transformery mogą nauczyć się tylko operacji z klasy TC0, która na standardowych założeniach (TC0 ≠ NC1) nie obejmuje tego, co potrzebne. Oznacza to, że architektura Transformera ma wbudowane ograniczenie, które teoretycznie uniemożliwia jej nauczenie się prawdziwej generalizacji strukturalnej z samych danych.

To wyjaśnia obserwowany w praktyce paradoks: systemy neuro-symboliczne rzeczywiście osiągają lepsze wyniki w benchmarkach, ale robią to poprzez ręczne wstrzyknięcie gotowych reguł semantycznych (Gγ), a nie ich nauczenie się. Badanie wskazuje, że benchmarki nie mogą rozróżnić między regułami naprawdę nauczonym a podanymi z góry - grzech pierworodny całej dziedziny. To kluczowe odkrycie dla zrozumienia fundamentalnych ograniczeń obecnych modeli języka.