Google uruchomił Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking - dwa nowe modele zoptymalizowane do pracy ze mową w czasu rzeczywistym, dedykowane dla produkcyjnych agentów głosowych. Oba stanowią rodzime modele speech-to-speech, czyli bezpośrednio przetwarzające głos bez pośrednich etapów konwersji. Modele są już dostępne w API oraz Google AI Studio jako usługi hostowane, bez opcji samodzielnego wdrażania.

Gemini 3.8 Live skupia się na skalowalności i efektywności kosztowej, łącząc inteligencję konwersacyjną z płynnym dialogiem i ugruntowaniem wizualnym. Gemini 3.8 Live Extended Thinking przeznaczony jest dla złożonych zadań, dodając zaawansowane zdolności rozumowania multi-step wykonywane podczas mówienia. Google pozycjonuje obie wersje jako uproszczoną alternatywę dla tradycyjnych pipelinów łańcuchujących ASR (rozpoznawanie mowy), LLM i TTS (syntezę mowy), eliminując punkt zmiany między komponentami.

Gemini 3.8 Live Extended Thinking zajął pierwsze miejsce w benchmarku Artificial Analysis' Speech to Speech Quality Index z wynikiem 82.6 i dominuje w zakresie realizacji zadań agentycznych z wynikiem 68.6% na τ-Voice i 35.1% na Sierra's τ-Voice-banking. Uzyskuje też 97.7% na Big Bench Audio, benchmarku testującym zdolności rozumowania modeli audio. Taki rozkład wyników sugeruje, że Google osiągnął znaczną przewagę w aspekcie multi-step reasoning podczas konwersacji, co otwiera nowe możliwości dla aplikacji wymagających logicznego myślenia w czasie rzeczywistym.