Alibaba udostępniła przez swoją chmurę Qwen-Audio-3.0-TTS, system zamiany tekstu na mowę w dwóch wariantach dostosowanych do różnych potrzeb produkcyjnych. Wariant Flash przeznaczony jest dla aplikacji wymagających szybkiej odpowiedzi, z opóźnieniem pierwszego pakietu na poziomie około 300 ms, natomiast Plus skupia się na najwyższej jakości syntezy, gdzie naturalizm i wierność barwy głosu są ważniejsze niż szybkość. Model dostępny jest wyłącznie jako usługa hostowana przez Alibaba Cloud Model Studio, bez możliwości pobrania wag.

System wspiera 16 języków i rozwiązuje cztery główne wyzwania stojące przed programistami wykorzystującymi TTS w produkcji: szerszą obsługę języków, naturalną kontrolę stylu mowy, precyzyjną kontrolę za pomocą tagów oraz odporność na niedoskonałe audio referencyjne. Interfejs API komunikuje się poprzez dwukierunkowy protokół WebSocket i obsługuje formaty PCM, WAV, MP3 i Opus z częstotliwością próbkowania do 48 kHz. Model umożliwia klonowanie głosu, Voice Design i kontrolę instrukcjami.

Qwen-Audio-3.0-TTS-Plus zajął pierwsze miejsce na niezależnym rankingu Artificial Analysis dla systemów zamiany tekstu na mowę. Alibaba dostarcza SDK DashScope oraz przykłady raw WebSocket w Pythonie, Javie, Go, C#, PHP i Node.js dla regionów Singapuru i Pekinu. Podstawą architektury jest niskiej częstotliwości tokenizer mowy (12,5 Hz), który zmniejsza złożoność dekodowania autoregressywnego.