Naukowcy zaprezentowali DLLM-TTS - framework łączący zalety szybkości i jakości w syntezie mowy z tekstu. Obecne systemy TTS stały przed dylematem: autoregresyjne modele języka kodeka dawały wysoce zrozumiałą mowę, ale wymagały ogromnych modeli i dużych zbiorów treningowych, zaś podejścia niutoregresyjne przyspieszały generację kosztem dokładności językowej. DLLM-TTS rozwiązuje ten problem, formułując zadanie TTS jako warunkową dyskretną dyfuzję blokową nad tokenami kodeka neuronowego X-Codec2.
Kluczowa innowacja polega na rozkładzie sekwencji na bloki i zastosowaniu maskowanej dyfuzji w obrębie każdego bloku przy sekwencyjnym przetwarzaniu bloków. To podejście pozwala modelowi nauczyć się zarówno lokalnej spójności akustycznej, jak i globalnego wyrównania tekst-mowa. Model o wielkości 0.6 miliarda parametrów został wytrenowany na 20 tysiacach godzin audio, co jest znacznie mniej wymagające niż tradycyjne podejścia.
Wyniki są imponujące: podczas wnioskowania równoległa predykcja tokenów w obrębie bloków umożliwia efektywną generację z czasem rzeczywistym (RTF) wynoszącym 0.15, co oznacza, że system generuje mowę 6-7 razy szybciej niż ją słyszymy. Model osiąga konkurencyjną wydajność na benchmarku Seed-TTS-eval, demon strując, że blokowa dyskretna dyfuzja otwiera drogę do praktycznych systemów syntezy mowy wymagających mniej danych i zasobów.