Black Forest Labs, zespół twórcy modeli generatywnych FLUX, opublikował FLUX 3 Action - otwarty model światowy do sterowania robotami, który przebija dotychczasowych faworytów w testach wydajności. Model wykorzystuje architekturę opartą na multimodalnym FLUX 3 i potrafi na podstawie wejścia z kamery, stanu robota i komendy tekstowej jednocześnie przewidywać przyszłe ramki wideo oraz kolejne ruchy manipulatora. Na benchmark'u RoboLab-120 uzyskuje rekordowe 42,92 procent sukcesu wykonywania zadań, przebijając dotychczasowego lidera NVIDIA'ego Cosmos 3 Nano z wynikiem 36,8 procent.

Wydajność FLUX 3 Action rozwiązuje historyczny dylemat w robotyce. Dotychczasowe modele do przewidywania wideo (WAM-y) takie jak Cosmos 3 Nano były dokładne, ale energożerne - wymagały około 4,7 razy więcej czasu obliczeniowego na jednostkę czasu ruchu robota niż szybkie modele VLA jak π0.5. Black Forest Labs osiągnęła przełom przez kombinację mniejszego backbone'u i destylacji wiedzy, zachowując jednocześnie wspólne przewidywanie wideo i akcji. Model jest wdrażalny na kartach graficznych z 24GB pamięci przy użyciu kwantyzacji FP8 i przesunięcia tekstu z GPU.

Mdel trenowany był głównie na danych wideo (ponad 95 procent tokenów), dodatkowo przetwarzając dane obrazów i audio. Podczas procesu mid-training mieszano dane pretraining'owe z danymi wyrównanymi do akcji robota. Licencja FLUX Komunity ogranicza jednak zastosowanie do użytku niekomercyjnego, co może wpłynąć na przyjęcie w przemysłowych aplikacjach robotycznych.