Google Research opracował system sztucznej inteligencji do profesjonalnego reżyserowania długich filmów opartych na czterech ramach agentowych działających na bazie modelów Gemini i Veo. Problem, jaki rozwiązuje, jest fundamentalny: podczas gdy modele dyfuzji generują wysokiej jakości krótkie klipy w kilka sekund, złożenie ich w spójną historię napotyka na dwa główne przeszkody. Po pierwsze, semantic drift - postaci zmieniają wygląd, kostiumy czy otoczenie między ujęciami, niszcząc wiarygodność historii. Po drugie, błędy kaskadowe, gdzie jeden słaby element upstream natychmiast degraduje wszystkie kolejne ujęcia.
System pracuje na warstwę wyżej, niezależnie od bazowych generatorów wideo. Pierwsza rama, Co-Director (zaakceptowana na konferencji COLM 2026), wykorzystuje algorytm multi-armed bandit do planowania kreatywnego. Orchestrator Agent wybiera konfigurację strategii twórczej, trybu narracyjnego i estetycznego archetypu, Pre-Production Agent buduje storyboard, a dedykowane sub-agenty produkują klatki kluczowe, wideo i dźwięk. Wszystko ocenia MLLM Judge, wysyłając czynnikowe sygnały nagrody zwrotnie do bandita. Druga rama, CANVAS (EMNLP 2026), rozwiązuje problem tożsamości postaci poprzez trwałą pamięć wizualną. Inne systemy w suicie dodają kolejne warstwy kontroli nad spójnością i jakością.
To znaczące przesunięcie w podejściu do generowania wideo. Zamiast łańcucha modułów z niezależnymi, ręcznie crafted promptami, Google proponuje architekturę agentową, gdzie każdy krok otrzymuje feedback i dostosowuje się do wcześniejszych decyzji. Wszystkie outputy dziedziczą watermarking SynthID od modelów bazowych, co dodaje warstwę weryfikalności. System jest model-agnostyczny, co oznacza, że ta warstwa orkiestracyjna może napędzać różne generatory, nie tylko własne narzędzia Google'a.