Zespół Qwen z Alibaby wypuścił Qwen3.8-LiveTranslate, następną generację modelu do równoczesnego tłumaczenia ustnego w czasie rzeczywistym. Znakiem firmowym rozwiązania jest zmniejszenie średniego opóźnienia z 2,8 do 2,3 sekundy - spadek o około 18 proc. Model słucha mowy na żywo, może analizować klatki wideo, i jednocześnie zwraca zarówno przetłumaczony tekst, jak i mowę, zanim mówca skończy wypowiadać się w języku źródłowym.

Kluczową zmianą jest nowa architektura Interleave, która przebudowuje kompromis między czasem czekania na większy kontekst a szybkością odpowiedzi dla słuchacza. Metryka LAAL (Length-Adaptive Average Lagging) mierzy, jak bardzo tłumaczenie opóźnia się za mową źródłową, unikając zarazem nagradzania systemów, które generują zbyt dużo tekstu. Model bazuje na stosie Qwen-Omni oraz wykorzystuje dane multimodalne w dużej skali, wyrównanie między językami i modalności oraz wzmacnianie wizualne.

Qwen3.8-LiveTranslate jest już dostępny jako hosted API na platformie Alibaba Cloud Model Studio i QwenCloud pod nazwą qwen3.8-livetranslate-flash-realtime z interfejsem WebSocket. Model wspiera 60 języków oraz nowe możliwości takie jak diaryzacja mówiącego w czasie rzeczywistym, zsynchronizowany wyświetlacz dwujęzyczny i disambiguacja w kontekście długich rozmów. Wersja Flash dodatkowo obsługuje tłumaczenie offline dla plików audio i wideo.