SpaceXAI oficjalnie uruchomił Grok Voice Transcribe 2.0, swój najnowszy model zamieniający mowę na tekst, który osiąga dokładnie dwa razy lepsze wyniki niż poprzednia generacja przy zachowaniu tej samej ceny abonamentu. Model dostępny jest jako hosted API pod identyfikatorem grok-voice-transcribe-2.0 i obsługuje zarówno przetwarzanie batch, jak i real-time streaming. SpaceXAI nie opublikował open weights, więc samodzielne hostowanie nie jest możliwe.

Model zbudowano na fundamencie audio, który już obsługuje dziesiątki tysięcy rozmów wsparcia klienta dziennie i transkrybuje miliony godzin narracji wideo. Zespół SpaceXAI uczył model na żywych, hałaśliwych danych wielojęzycznych nagrywanych w zróżnicowanych środowiskach, a następnie doskonalił go poprzez post-training. Grok Voice Transcribe 2.0 specjalizuje się w trudnych warunkach - zarówno w hałaśliwych liniach telefonicznych, jak i sytuacjach z nakładającymi się głosami, lokalnymi akcentami czy wypowiadanymi hasłami dostępu.

Zgodnie z raportami SpaceXAI, model zajął pierwsze miejsce w dokładności wśród 32 modeli streamingowych na publicznym leaderboardzie Artificial Analysis, mierzonym benchmarkiem AA-WER Streaming. Wynik jest szczególnie istotny dla branży obsługi klienta i aplikacji asystentów głosowych, gdzie dokładna transkrypcja jest kluczowa dla doświadczenia użytkownika i integracji z systemami automatyzacji.