Naukowcy opublikowali kompleksową analizę probabilistycznej struktury wielkich modeli językowych, która integruje rozmaite koncepcje zwykle rozproszone w literaturze akademickiej. Prace wykorzystuje formalny aparat teorii prawdopodobieństwa do opisania LLM-ów poprzez miary probabilistyczne na zbiorach sekwencji tokenów, zdefiniowane za pomocą warunkowych rozkładów autoregresywnych.
Praca pokazuje, że trening modeli można sformułować jako problem maksymalizacji wiarygodności rozwiązywany metodami stochastycznego gradientu, podczas gdy generowanie tekstu postrzega się jako sekwencyjną symulację wynikającego procesu stochastycznego. Kluczowym teoretycznym wkładem jest analiza roli asymetrii dywergencji Kullbacka-Leiblera w wyjaśnianiu charakterystycznych zjawisk takich jak halucynacje modeli oraz różnica między plauzybilnością statystyczną a prawdą faktyczną.
Autorzy rozszerzają perspektywę również na modele dyfuzyjne, które zamiast predykcji tokenów sekwencyjnie operują na funkcjach wyników, generując dane poprzez symulację procesów stochastycznych w czasie odwrotnym, zarówno w wariantach dyskretnych jak i ciągłych. To podejście unifikujące mogą pomóc badaczom lepiej zrozumieć fundamentalne mechanizmy działania współczesnych modeli generatywnych.