Generowanie wideo. Model tworzy klipy o długości do 20 sekund, a dźwięk generuje natywnie i synchronicznie z obrazem w ramach jednego procesu . Obsługiwane tryby obejmują tekst-na-wideo, obraz-na-wideo, wideo-na-wideo, generowanie na podstawie klatek kluczowych oraz łączenie wielu klipów w bardziej rozbudowanym, agentowym przepływie pracy . Według dostępnych opisów wyjście może osiągać rozdzielczość 1080p przy 24 klatkach na sekundę, a model oferuje spójność między ujęciami i kontrolę kamery .
Generowanie dźwięku. Audio powstaje razem z wideo. Może obejmować wielojęzyczne dialogi i efekty dźwiękowe powiązane przyczynowo z wydarzeniami widocznymi na ekranie . Deklarowany format wyjściowy to stereo 48 kHz .
Obrazy i ich edycja. FLUX 3 ma generować oraz edytować obrazy w różnych stylach, proporcjach i rozdzielczościach. BFL wskazuje także na lepsze odwzorowywanie tekstu oraz obsługę bardziej złożonych poleceń . Funkcja obrazowa nie była jednak dostępna w momencie premiery — wczesny dostęp miał rozpocząć się „w nadchodzących tygodniach” .
Przewidywanie działań. Rozumienie świata przez FLUX 3 można wykorzystać do przewidywania ruchów robotów, bezpośrednio albo za pomocą dodatkowego, dostrojonego dekodera działań . W założeniu ten sam model może więc służyć zarówno do tworzenia treści, jak i jako wspólna baza dla systemów sterowania fizycznymi maszynami .
Jedna architektura multimodalna. FLUX 3 bazuje na podejściu Self-Flow, które ma łączyć generowanie multimodalne z uczeniem reprezentacji w jednym systemie . BFL i mimic robotics opisują interesujący kompromis treningowy: dodanie przewidywania działań początkowo obniża jakość wideo nawet o 10 proc., lecz po około 3500 krokach treningu model odzyskuje pełną jakość, zachowując zdolność przewidywania działań .
Black Forest Labs współpracuje ze szwajcarskim startupem mimic robotics nad systemem FLUX-mimic — modelem wideo-akcji zbudowanym na bazie FLUX 3 . Rozwiązanie wykorzystuje lekki dekoder działań trenowany na pośrednich cechach z toru predykcji wideo FLUX 3. W praktyce dekoder odczytuje działania fizyczne z reprezentacji świata wyuczonej przez model .
FLUX-mimic został przetestowany i wdrożony w rzeczywistych zadaniach produkcyjnych w Audi . Według partnerów roboty wykonywały złożone zadania manipulacji miękkimi obiektami, które przy tradycyjnym programowaniu miały być po prostu niemożliwe . System ma także wymagać mniejszej liczby demonstracji do nauczenia nowego zadania niż wcześniejsze podejścia .
Współpraca łączy doświadczenie BFL w budowie wizualnych modeli fundamentowych z kompetencjami mimic robotics w uczeniu robotów, zręcznej manipulacji i wdrażaniu automatyzacji w produkcji . Nie oznacza to jednak, że FLUX 3 jest już uniwersalnym systemem sterowania dowolnym robotem. Dostęp do funkcji akcji odbywa się przez wybranych partnerów badawczych i komercyjnych.
W dyskusjach społecznościowych pojawiają się konkretne liczby: poniżej 80 ms na inferencję na jednej karcie RTX 5090 oraz 101 ms całkowitego czasu reakcji systemu. Nie ma ich jednak w dostępnych oficjalnych materiałach Black Forest Labs, w relacjach z dnia premiery ani w przywoływanych komunikatach prasowych .
Najbezpieczniejszy wniosek jest więc prosty: FLUX 3 projektowano z myślą o sterowaniu robotami w czasie rzeczywistym lub zbliżonym do rzeczywistego, ale BFL nie opublikowało dotąd oficjalnej specyfikacji opóźnień dla konsumenckich kart graficznych. Wspomniane wartości mogą pochodzić z nieopublikowanego raportu technicznego, analizy zewnętrznej albo późniejszych testów, lecz na podstawie obecnego zestawu źródeł nie da się ich zweryfikować.
Dla kontekstu, testy poprzednich modeli FLUX na RTX 5090 wskazują raczej na czasy liczone w sekundach przy generowaniu pojedynczego obrazu 1024 × 1024, zależnie od wariantu i optymalizacji . Nie jest to bezpośrednie porównanie z predykcją działań robota — obciążenia są zupełnie inne — ale tym bardziej nie należy przedstawiać niepotwierdzonego wyniku poniżej 100 ms jako oficjalnego benchmarku FLUX 3.
Wniosek o dostęp można złożyć na stronie BFL: bfl.ai/models/flux-3 . Na tym etapie FLUX 3 jest przede wszystkim obiecującą platformą multimodalną w ograniczonym dostępie, a nie gotowym, publicznie dostępnym zamiennikiem wszystkich narzędzi do generowania obrazu, wideo i sterowania robotami.