NVIDIA udostępniła w otwartym dostępie model SANA-WM, który zmienia podejście do generowania wideo - potrafi tworzyć filmy o rozdzielczości 720p trwające do minuty na jednym GPU, wymagając zaledwie 2,6 miliarda parametrów. To world model, czyli system szkolony na przewidywaniu kolejnych klatek wideo, który w proces uczy się rozumienia fizyki i dynamiki otaczającego świata. Wydajność na pojedynczym procesorze graficznym to kwalifikacja dla tego rozwiązania - dotychczas tego typu modele były zazwyczaj dostępne dla dużych laboratoriów badawczych dysponujących ogromną mocą obliczeniową. Teraz sytuacja się zmienia, a bariera wejścia dla innowatorów spada drastycznie.
Udostępnienie SANA-WM w wersji open-source to strategiczny ruch NVIDII mający na celu demokratyzację dostępu do technologii generowania wideo. Model trafia w ręce naukowców, programistów i startupów, którzy dotychczas byli ograniczeni kosztami i dostępnością sprzętu. Szczególnie ważne jest to dla branży robotyki i symulacji fizycznej - world modele mogą wspomagać planowanie ruchów robotów, testowanie scenariuszy bez konieczności budowania fizycznych prototypów czy szkolenie systemów autonomicznych w wirtualnych środowiskach.
Efektywność SANA-WM rzuca nowe światło na całą dyskusję o skalowaniu modeli AI. Zamiast tradycyjnego podejścia zmierzającego w stronę coraz większych sieci, NVIDIA pokazuje, że inteligentna architektura i precyzyjne szkolenie pozwalają osiągnąć imponujące wyniki przy relatywnie kompaktowych parametrach. To może inspirować branżę do poszukiwania sposobów na zwiększenie wydajności istniejących systemów zamiast tylko budowania większych maszyn. Wiele wskazuje, że to dopiero początek ery bardziej dostępnych, praktycznych narzędzi AI.