Google udostępnił dwa nowe modele zamiany tekstu na mowę - gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts. Oba modele obsługują bibliotekę ponad 2000 gotowych głosów, a dodatkowo pozwalają na utworzenie niestandardowego głosu na podstawie zaledwie 30-sekundowego nagrania audio wybranego głosu lub głosu, do którego masz prawa autorskie.
Developer Simon Willison stworzył interaktywny playground do testowania tych modeli, działający w przeglądarce internetowej. Narzędzie wykorzystuje otwartą politykę CORS API Gemini i umożliwia definiowanie pełnych rozmów między wieloma postaciami, każdą z własnym głosem i instrukcjami dotyczącymi stylu mówienia. W demonstracyjnym klipie dwie pelikany debatują, czy powinny się przenieść na Pacifica Pier - scenariusz napisał Claude 4.5 Opus, a URL do renderowania wygenerowany został za pomocą narzędzia.
Generowanie 1 minuty i 18 sekund audio za pomocą Gemini 3.8 Flash TTS zajęło około 20 sekund i kosztowało 2,74 centa. Tańsza wersja Flash-Lite powinna oferować jeszcze bardziej konkurencyjne ceny przy pewnie nieco gorszej jakości. To potencjalnie przełomowe rozwiązanie dla twórców treści, podcasterów i firm pracujących nad automatyzacją mowy, szczególnie biorąc pod uwagę możliwość łatwego dostosowania głosów do swoich potrzeb.