Badacze opracowali NCP-ArchPreview, model języka łączący predykcję tokenów na poziomie słów z nowatorskim podejściem opartym na predykcji konceptów - dyskretnych pojęć obejmujących wiele tokenów jednocześnie. Model buduje przestrzeń latentną poprzez skonstruowanie słownika konceptów bezpośrednio z jego stanów ukrytych, używając kwantyzacji produktu, a następnie uczy się przewidywać przyszłe koncepty za pośrednictwem dedykowanego Modułu Konceptów. Te przewidziane koncepty są zwracane na poziom tokenów, aby kierować generacją tekstu, przy czym predykcja tokenów i konceptów trenują się wspólnie end-to-end.
Model osiągnął rozmiar 8,9 miliarda parametrów i był trenowany na 5,73 bilionach tokenów z datasetu Dolma-3, co stanowi największą dotąd demonstrację modelu języka opartego na przestrzeni latentnej. Najbardziej imponujące jest, że model osiągnął stratę pretrainingową OLMo-3-7B (konkurencyjnego modelu 7-miliardowego) zużywając zaledwie 51,3 procenta tokenów treningowych i 85 procent standardowych zasobów obliczeniowych. Po pełnym pretrainingowaniu NCP-ArchPreview przewyższył OLMo-3-7B o 2,45 punktu na makro-średniej wyników, z szczególnie imponującymi wzrostami o 5,99 punktu na benchmarku GSM8K (zadania matematyczne).
Kontrolowane eksperymenty wykazały, że zyski wydajności pochodzą zarówno z architektury latentnej, jak i z celu NCP. Wyniki sugerują, że wprowadzenie predykcji pojęć na wyższym poziomie abstrakcji, zamiast tylko sekwencji tokenów, może prowadzić do bardziej efektywnego trenowania dużych modeli języka - potencjalnie ważny krok w kierunku bardziej zoptymalizowanych i ekonomicznych architektur AI.