Naukowcy z Polski opublikowali Wieszcz-XIX, pierwszy w swoim rodzaju korpus zawierający 6,75 miliarda tokenów polskiej literatury i czasopism z okresu 1800-1918. Zbiór zawiera 3,1 miliarda słów zgromadzonych z 294 369 dokumentów pochodzących z Wolnych Lektur i Internet Archive, co czyni go tysiące razy większym niż wcześniej dostępne adnotowane zasoby dla tego okresu.
Zbudowanie tak dużego zbioru wymagało rozwoju specjalistycznego pipeline'u przetwarzającego historyczne dokumenty zeskanowane przy pomocy optycznego rozpoznawania znaków. Zespół starannie odfiltrował, deduplikował dane, a także usunął niezamierzone wycieeki współczesnych tekstów datowanych na po-1918. Badacze oszacowali błędy rozpoznawania tekstu na poziomie 0,68% dla czytelnych fragmentów, choć 45% próbki zawierało zbyt wiele znaków do ręcznej korekcji.
Na podstawie tego korpusu wytrenowano cztery modele decoder-only o rozmiarach od 47 milionów do 349 milionów parametrów. Wyniki pokazują, że modele historyczne osiągają lepszą wydajność na tekstach z 1800-1918 w porównaniu z dużo większymi współczesnymi modelami polskiego języka, co dowodzi, że specjalistyczne modele trenowane na okresowych danych mogą być bardziej przydatne do badań historycznych i cyfrowych humanistyk niż zwykłe modele base.