Microsoft AI wydał 1 października 2026 MAI-Transcribe-2-Streaming, swój pierwszy model zamiany mowy na tekst przeznaczony do pracy w czasie rzeczywistym. Model został zaklasyfikowany na pierwszym miejscu wśród 38 konkurencyjnych rozwiązań przez niezależny benchmark Artificial Analysis, zarówno pod względem dokładności ostatecznego transkryptu jak i początkowych hipotez. W testach Artificial Analysis osiągnął dokładność 2,5% WER przy opóźnieniu 0,13 sekundy po zakończeniu mówienia, znacznie wyprzedzając drugiego konkurenta - Grok Voice Transcribe 2.0 z wynikiem 2,7% WER i 0,49 sekundy.
MAI-Transcribe-2-Streaming działa jako stream-processing wersja wcześniej wydanego w wrześniu modelu MAI-Transcribe-2. Głos przychodzi w postaci ciągłego strumienia danych, a tekst wraca do użytkownika w czasie rzeczywistym, jeszcze gdy osoba mówi. Model obsługuje 60 języków z automatycznym, ciągłym wykrywaniem zmiany języka. Kluczową cechą jest emisja początkowych hipotez zwanych partiałami już po około 100ms od otrzymania audio, które następnie ulegają zmianom w miarę napływu dodatkowego kontekstu, aż do ostatecznego transkryptu. Zespół Microsoftu twierdzi, że w wewnętrznych testach słowa pojawiają się dwukrotnie szybciej niż u najbliższego konkurenta.
Nowa technologia ma istotne znaczenie dla branży asystentów głosowych, systemów napisów na żywo i rozpoznawania dyktowania, gdzie niska latencja decyduje o jakości doświadczenia. Możliwość rozpoczęcia rozumowania lub wywoływania narzędzi w połowie zdania otwiera nowe możliwości dla zaawansowanych systemów konwersacyjnych. Jednocześnie wydano dwa modele zamiany tekstu na mowę - MAI-Voice-2.1 i MAI-Voice-2.1-Flash, uzupełniające portfolio produktów komunikacyjnych Microsoftu.