Generování videa: Model dokáže vygenerovat až 20sekundový videoklip s nativně synchronizovaným zvukem v jediném průchodu . Podporuje převod textu na video, převod obrazu na video, úpravu videa pomocí jiného videa, generování mezi klíčovými snímky i řetězení více klipů pomocí agentních pracovních postupů . Výstup může dosahovat rozlišení 1080p při 24 snímcích za sekundu a model nabízí také řízení kamery a konzistenci napříč více záběry .
Generování zvuku: Zvuk vzniká společně s videem. Patří sem vícejazyčný dialog i zvukové efekty, které mají být příčinně propojené s tím, co se ve scéně odehrává . Výstup je ve 48kHz stereu .
Tvorba a úprava obrazů: FLUX 3 má vytvářet a upravovat obrazy v různých stylech, poměrech stran a rozlišeních. BFL uvádí také lepší vykreslování textu a práci se složitějšími zadáními . Přístup k obrazové generaci měl po uvedení následovat „v příštích týdnech“ .
Předvídání akcí: Porozumění světu, které model získává při práci s vizuálními a zvukovými daty, lze využít k předvídání pohybů robotů – buď přímo, nebo prostřednictvím dodatečně natrénovaného dekodéru akcí . FLUX 3 tak může sloužit jako společný základ pro kreativní nástroje i ovládání robotů v reálném světě .
Jednotná architektura: Model vychází z přístupu Self-Flow, který v jednom rámci propojuje multimodální generování a učení reprezentací . BFL a mimic robotics uvádějí, že přidání předvídání akcí nejprve snížilo kvalitu videa až o 10 procent. Po přibližně 3 500 trénovacích krocích se však kvalita vrátila na původní úroveň, zatímco schopnost předvídat akce zůstala zachována .
Black Forest Labs spolupracuje se švýcarským startupem mimic robotics na modelu FLUX-mimic, který využívá základ FLUX 3 pro převod videa na robotické akce . Systém trénuje lehký dekodér akcí nad mezivýstupy z videopredikční části FLUX 3. Z nich následně odvozuje fyzické pohyby podle reprezentace světa, kterou se model naučil .
FLUX-mimic byl podle partnerů testován a nasazen při skutečných výrobních úkolech v Audi . Audi mělo tyto roboty využít k řešení „složitých úloh manipulace s měkkými předměty“, které by tradiční programování jednoduše nezvládlo . Partneři zároveň uvádějí, že systém potřebuje k naučení nových úloh méně demonstračních dat než některé dosavadní přístupy .
Spolupráce spojuje zkušenosti BFL s vizuálními základními modely a know-how mimic robotics v oblasti učení robotů, obratné manipulace a nasazování ve výrobě .
Na internetu se objevují konkrétní údaje o inferenci pod 80 ms na jediné kartě RTX 5090 a o systémové reakci za 101 ms. Tyto hodnoty však nejsou uvedeny v dostupných oficiálních materiálech BFL, v článcích Bloomberg ani v oficiálních tiskových zprávách . Ani blogové příspěvky BFL z uvedení modelu 23. července 2026 neobsahují takové hardwarově specifické benchmarky .
Je možné, že čísla pocházejí z dosud nezveřejněné technické zprávy, analýzy třetí strany nebo pozdějšího testování. V dostupných zdrojích ale není dost důkazů k jejich ověření. FLUX 3 je sice navržen s ohledem na řízení robotů v reálném či téměř reálném čase, oficiální údaj o latenci na spotřebitelských grafických kartách zatím zveřejněn nebyl.
Pro srovnání: předchozí FLUX.1 podle komunitních a dalších nezávislých měření generuje obraz 1024 × 1024 na kartě RTX 5090 přibližně za 5 až 12 sekund, v závislosti na optimalizaci. U modelu FLUX.2-dev se rovněž objevují časy v řádu sekund na jeden obraz . Generování videa a předvídání robotických akcí ale představují výrazně odlišnou zátěž. Tvrzení o latenci pod 100 ms proto nelze bez oficiálního měření automaticky přenášet na celý systém FLUX 3.
O předběžný přístup lze požádat na formuláři BFL na adrese bfl.ai/models/flux-3 .