Black Forest Labs wydała FLUX 3, swój pierwszy model budowany w pełni na zasadzie uczenia się od wielu modalności jednocześnie. To przełomowy krok, bo dotychczasowe podejścia traktowały obrazy, wideo i audio oddzielnie, tracąc informacje o tym, jak rzeczywistość pracuje w istocie.

Model zbudowany jest na metodzie Self-Flow, łączącej flow matching z self-supervised feature reconstruction. To oznacza, że sieć uczy się przewidywać, jak modalne się nawzajem uzupełniają - dźwięk musi zgadzać się z widocznym zderzeniem, ruch musi respektować fizykę mas obiektów. Architektura wykorzystuje SiT-XL/2 z warunkowym timestepem na token, trenując się z 25 procentową maską per-token i samoistotnością od nauczyciela EMA na warstwie 20 do ucznia na warstwie 8.

Black Forest Labs skalowała znacznie zasoby obliczeniowe i dane treningowe w stosunku do wcześniejszej implementacji reference na GitHubie. To podejście może zmienić sposób, w jaki rozumiemy generowanie multimediów - nie traktując już obrazów, dźwięku i ruchu jako niezależnych aspektów, ale jako spójne projekcje tej samej rzeczywistości fizycznej. Implikacje sięgają robotyki, syntezy video, a nawet zrozumienia scen przez AI.