Google wydał Gemini 3.5 Transcribe, nowy model zamieniający mowę na tekst rozprowadzany przez dwa odrębne endpointy API z różnymi funkcjami i cenami. Wersja gemini-3.5-transcribe obsługuje pliki nagrań przez Interactions API z wskaźnikiem błędu słowa 2,6%, natomiast gemini-3.5-transcribe-live umożliwia transmisję bidirectional przez Live API z błędem 4,0%. Automatyczne wykrywanie obejmuje ponad 85 języków i potrafi obsługiwać zmianę kodu w środku zdania - praktyczne dla multilinguistycznych usecase'ów.
Model przyspiesza finalne transkrypcję o 70% w stosunku do poprzednika Chirp 3, co stanowi znaczną poprawę wydajności dla aplikacji wymagających szybkiego przetwarzania. Rozwiązanie dostępne jest wyłącznie poprzez API - Google nie udostępnia wag modelu ani opcji self-hostingu, co oznacza zarządzaną usługę, a nie infrastrukturę do samodzielnego wdrożenia. Tym samym organizacje nie mogą uruchamiać modelu na własnych serwerach.
Dostęp warstwowany - deweloperzy i startupy mogą zacząć na bezpłatnym tierze Gemini API przez Google AI Studio, zespoły średniej wielkości mają dostęp do wersji paid z wyższymi limitami, a przedsiębiorstwa regulacyjne mogą korzystać z Gemini Enterprise Agent Platform oferującego dedykowaną przepustowość i kontrole compliance. Oba tory są w public preview, więc produkcyjne zaangażowanie wymaga ostrożności. Zastosowania obejmują call centra, dokumentację kliniczną i lokalizację treści medialnych.