Google uruchomił agentic video understanding dla swoich modeli Gemini Flash, fundamentalnie zmieniając sposób przetwarzania zawartości wideo. Zamiast obowiązkowego przetwarzania całej ścieżki czasowej przy ustalonej szybkości klatki, model Gemini teraz autonomicznie decyduje, które segmenty oglądać, z jaką szybkością klatki i w której modalności - wideo, audio czy transkrypcja. To podejście eliminuje dotychczasowy dylemat: albo płacić za pełną timeline w kontekście, albo wstępnie dzielić wideo i ryzykować utratę ważnych szczegółów.

Wdrożenie przynosi solidne rezultaty - Google raportuje zmniejszenie liczby tokenów do 88%, obniżkę kosztów do 66% i wzrost dokładności do 7% na standardowych benchmarkach. Stary system przetwarzania działa statycznie, ekstrahując klatki w tempie 1 FPS w jednym przebiegu, przetwarzając audio przy 1 Kbps na pojedynczym kanale. Nowy system zamienia to w pętlę, gdzie model łączy własne rozumowanie z natywnymi narzędziami wideo do wyszukiwania, skanowania i inspekcji docelowych segmentów.

Funkcja dostępna jest wyłącznie jako API z hostingiem u Google - nie ma wersji open weights ani opcji self-hostingu. Uruchamiana jest przez Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform, obsługuje zarówno przesyłanie plików jak i publiczne adresy YouTube, a rozliczana jest standardowymi cenami tokenów Gemini bez dodatkowych opłat za funkcję.