Google oficjalnie wydał dwa dedykowane modele TTS Gemini 3.8 Flash, rozszerzając swoją gamę narzędzi do syntezy mowy. Gemini 3.8 Flash TTS przeznaczony jest dla zespołów kreatywnych zajmujących się grami, produkcją interaktywnej rozrywki i narracją długoformatową, podczas gdy Gemini 3.8 Flash-Lite TTS skupia się na zautomatyzowanych zastosowaniach takich jak dubbing mediów, chatboty dla użytkowników końcowych i potoki tłumaczeń wysokotonażowych.
Oba modele oznaczają znaczące poszerzenie oferty audio Google, która wcześniej obejmowała 3.5 Live Translate, 3.5 Transcribe oraz 3.8 Live i 3.8 Live Extended Thinking. Zamiast starego podejścia z katalogiem 30 głosów, nowe systemy udostępniają ponad 2000 wstępnie zbudowanych profili głosowych obejmujących ponad 100 języków z wariantami regionalnymi - od francuszczyzny québeckiej, przez angielski szkocki po hiszpańszczyznę meksykańską. Nadchodzący moduł remixu głosu umożliwi inżynierom audio dostrajanie barwy, wysokości, tempa i akcentów poprzez bezpośrednie komendy tekstowe.
Niezależne testy potwierdzają konkurencyjność rozwiązania. Model Gemini 3.8 Flash TTS uzyskał wynik 71.4 w benchmark Hume AI Voice Design, a szczególnie imponuje jego rating 60.8 w modelowaniu akcentów - najwyższy w kategorii. Te wyniki pokazują, że Google zdołał wdrożyć znaczącą poprawę jakości syntezy mowy, co jest szczególnie ważne dla profesjonalnych produkcji audio wymagających naturalnie brzmiących głosów w różnych wersjach językowych.