Google wydał Gemini Omni 1.1 Flash, produkcyjną aktualizację swojego natywnego modelu do generowania i edycji wideo. Ten model zmienia podejście do tworzenia materiałów wideo - zamiast od zera generować, teraz można precyzyjnie edytować istniejące fragmenty.
Główną zmianą jest rozszerzenie scen: model analizuje do 10 sekund wcześniejszego kontekstu zamiast tylko ostatniej klatki, co pozwala na znacznie lepsze zrozumienie, jak powinna wyglądać kontynuacja. Użytkownik może rozszerzać clipy w przyrostach 10-sekundowych do łącznie 40 sekund, generując po 3-10 sekund na wywołanie. Ważną funkcją jest możliwość przypinania pierwszej i ostatniej klatki, co daje kontrolę nad ruchami kamery. Drafty renderują się w 360p za trzecią część kosztu wersji 720p, a finalne wydania upscalują się do 4K. Model obsługuje też referencje wideo dla spójności postaci.
Gemini Omni 1.1 Flash jest zbudowany na trzech właściwościach - natywnej multimodalności (text, obraz, audio i wideo przetwarzane razem), konwersacyjnej edycji przez API Interactions oraz wiedzy światowej dziedziczonej z Gemini. Edycja jest stanowa, co oznacza że model zachowuje poprzednie zmiany bez konieczności ponownego uploadu wideo. Model jest już dostępny przez Gemini API w Google AI Studio i platformie Gemini Enterprise Agent Platform, a producenci jak Adobe, Figma i Runway już go wdrażają.