Google udostępnił dwa nowe modele zamiany tekstu na mowę: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, które trafią do rodziny Gemini Audio. Oba modele dostępne są od teraz przez Gemini API i Google AI Studio, choć dostęp jest wyłącznie poprzez API - bez otwartych wag do samodzielnego hostowania. Dostęp dla enterprise'u poprzez Gemini Enterprise ma pojawić się wkrótce.
Gemini 3.8 Flash TTS to bardziej zaawansowana wersja dla projektów wymagających głębokich decyzji twórczych. Skierowana jest do gier, immersyjnych audiobook'ów, podcastów i mediów interaktywnych. Model oferuje precyzyjną kontrolę nad hinkami aktorskimi, tempem mówienia, zmianami akcentu i przerywnikami. Natomiast Gemini 3.8 Flash-Lite TTS to wersja optymalizowana dla dużych wolumenów i efektywności kosztowej, przeznaczona do dubingu, tworzenia treści audio i ekspresyjnych agentów głosowych. Oferuje szczegółową kontrolę nad tonem, tempem i nuansami wyrazu.
Zmiana modeluje się wokół generatywnego projektowania głosu - zamiast wyboru z listy 30 oryginalnych głosów, twórcy mogą teraz generować nowe głosy bezpośrednio z opisu tekstowego. To stanowi znaczący skok w elastyczności dla produkcji mediów i aplikacji interaktywnych, pozwalając na bardziej spersonalizowane i kontekstowe doświadczenia audio.