Zespół badaczy zaproponował nową architekturę autoenkoderu, która uczy się kompresować tekst poprzez residualne downscaling i upscaling reprezentacji ukrytych wzdłuż osi czasu, z dyskrenym wąskim gardłem o niskiej wymiarowości. Podejście można zaliczyć do pogranicza kompresji danych i representation learning - połączenia dyscyplin, które rzadko się spotykają w praktyce.

Badacze testowali różne metody kwantyzacji, cele treningowe i zbiory danych. Kluczowe odkrycie: osiągnęli kompresję na poziomie 2,24 bitów na bajt na tekście webowym, co jest porównywalne z wciąż najlepszymi algorytmami bezstratnej kompresji. Równocześnie ewaluowali jakość poprzez metryki zarówno powierzchniowe (BLEU - porównanie słów) jak i głębokie, używając sędziego opartego na dużym modelu języka (LLM) do oceny znaczenia semantycznego. Dodatkowo testowali zdolności modelu na zadaniach downstream takich jak odpowiadanie na pytania i podobieństwo tekstów semantycznych.

To badanie ma znaczenie dla efektywności przechowywania i transmisji tekstu w epoce rosnących modeli AI. Stratna kompresja tekstowa, zachowując istotę semantyczną, mogłaby zmienić sposób, w jaki pracujemy z dużymi zbiorami danych lingwistycznych. Wyniki sugerują, że głębokie uczenie może konkurować z klasycznymi algorytmami kompresji, co otwiera nowe perspektywy dla systemów pamięciowych i retrieval augmented generation.