Google DeepMind zaprezentował nową funkcjonalność w modelach Gemini, która dodaje agentyczne zdolności do rozumienia materiałów wideo. Ta nowa warstwa pozwala modelom nie tylko analizować zawartość filmów, ale także autonomicznie planować sekwencje działań i podejmować decyzje na podstawie tego, co widzą.
Agentic video understanding stanowi significant krok w ewolucji multimodalnych modeli AI. Gemini wcześniej posiadał już zdolności do analizy obrazów i wideo, ale nowa warstwa dodaje autonomiczność - modele mogą teraz działać jak agencie, które rozumieją kontekst wizualny i reagują na niego samodzielnie. To oznacza, że zamiast prostej analizy tego co jest na ekranie, system może formułować plan działań, przewidywać następstwa i iteracyjnie doskonalić podejście do problemu.
Ta innowacja ma potencjalne zastosowania w wielu domenach - od automatyzacji procesów biznesowych poprzez analizę materiałów edukacyjnych, po wsparcie dla osób niepełnosprawnych. W praktyce agentic video understanding może być wykorzystywany do monitorowania procesów produkcyjnych, wspomagania szkolenia pracowników czy analizy złożonych scenariuszy wymagających zrozumienia dynamiki zmian w czasie.