Naukowcy z arXiv opublikowali POSPAN, framework ulepszający wstępne trenowanie modeli języka poprzez inteligentniejsze maskowanie fragmentów tekstu. Zamiast losowo wybierać fragmenty do ukrycia, metoda ta bierze pod uwagę pozycje i długości maskowanych sekwencji w kontekście całego tekstu.

Maskowanie na poziomie fragmentów (zamiast pojedynczych słów) ma sens, ponieważ jednostkami języka są często całe frazy i byty. Poprzednie badania pokazały, że maskowanie fragmentów przynosi lepsze wyniki niż tradycyjne MLM, ale zignorowały związki między pozycjami tych fragmentów. POSPAN uzupełnia tę lukę, łącząc rozkład długości fragmentów z rozkładem ograniczeń pozycyjnych, tworząc jednolity framework, który obejmuje wszystkie poprzednie metody.

Wyniki eksperymentów na standardowych benchmarkach NLU potwierdzają, że podejście pozycyjne rzeczywiście poprawia jakość modelów. Najlepsze konfiguracje POSPAN konsekwentnie bijąJą zarówno waniliowe MLM, jak i metody maskowania fragmentów ignorujące pozycje. Zespół wykonał również analizę teoretyczną wyjaśniającą, dlaczego ograniczenia pozycyjne działają lepiej, co wskazuje na fundamentalny wkład w zrozumienie, jak trenować modele języka.