Alibaba Qwen wypuszcił Qwen-Audio-3.1-Realtime, pełnodupleksowy model głosu zdolny do samodzielnego decydowania, kiedy słuchać, mówić lub czekać w trakcie rozmowy. System zawiera pięć modeli audio przeznaczonych do automatycznego rozpoznawania mowy, syntezy głosu i rzeczywistej interakcji z użytkownikami. Architektura opiera się na dwóch głównych komponentach: modelu decyzyjnym, który przewiduje, czy system powinien kontynuować słuchanie, zacząć mówić czy zatrzymać wypowiedź, oraz modelu zamieniającym tekst na streaming mowy.

Model Realtime dostępny jest na platformie QwenCloud przez WebSocket z kontekstem 262 tys. tokenów. Ceny wynoszą 6,4 dolara za milion tokenów wejściowych audio i 0,8 dolara za milion tokenów tekstu, a wyjścia kosztują 24 dolary za milion tokenów. Jednocześnie Alibaba drastycznie obniżyła ceny - nawet o 85% dla modelu Realtime, około 70% dla syntezy głosu i do 95% dla funkcji ASR. Towarzyszący model Qwen-Audio-3.1-ASR-Flash-Filetrans obsługuje transkrypcję długich nagrań offline z rozpoznawaniem dialektów chińskich i separacją głosów mówiącego.

Chociaż model nie został udostępniony w otwartych wagach, system oferuje zaawansowane funkcje takie jak wywoływanie narzędzi, wyszukiwanie internetowe i strukturyzowane wyjścia. To stanowi znaczący krok w kierunku bardziej naturalnych asystentów głosowych, którzy mogą rzeczywiście rozumieć kontekst konwersacji i reagować w czasie rzeczywistym bez sztywnych wzorców.