FLUX 3 kan videoclips van maximaal 20 seconden genereren, inclusief native en gesynchroniseerde audio, in één generatiegang . De vroege toegang ondersteunt onder meer:
Volgens de beschikbare informatie kan de uitvoer een resolutie van 1080p en 24 beelden per seconde bereiken. Ook worden meer-shotconsistentie en cameracontroles genoemd .
Het geluid wordt samen met de video gegenereerd. Dat omvat meertalige dialogen en geluidseffecten die inhoudelijk zijn gekoppeld aan wat er in beeld gebeurt . De opgegeven uitvoer is 48 kHz stereo .
Naast video en audio is FLUX 3 bedoeld voor het genereren en bewerken van afbeeldingen in uiteenlopende stijlen, beeldverhoudingen en resoluties. BFL noemt ook verbeterde tekstweergave en een betere verwerking van complexe prompts . Bij de lancering was de beeldfunctie nog niet beschikbaar; vroege toegang zou in de daaropvolgende weken volgen .
De opvallendste uitbreiding is actievoorspelling. FLUX 3 kan worden gebruikt om te voorspellen welke handeling een robot vervolgens moet uitvoeren, rechtstreeks of via een speciaal getrainde actiedecoder . Zo ontstaat één gedeelde modelbasis voor zowel creatieve content als fysieke robotbesturing .
De architectuur bouwt voort op BFL’s Self-Flow-aanpak, waarmee multimodale generatie en representatie leren binnen één raamwerk op elkaar worden afgestemd . BFL beschrijft daarbij een opvallend trainingseffect: wanneer actievoorspelling wordt toegevoegd, daalt de videokwaliteit tijdelijk met maximaal 10 procent. Na ongeveer 3.500 trainingsstappen herstelt de volledige kwaliteit, terwijl de mogelijkheid om acties te voorspellen behouden blijft .
Black Forest Labs werkt samen met de Zwitserse startup mimic robotics aan FLUX-mimic, een video-actiemodel dat op de FLUX 3-backbone is gebouwd . Het systeem gebruikt tussentijdse kenmerken uit het videovoorspellingspad van FLUX 3. Een lichte actiedecoder vertaalt die geleerde wereldrepresentatie vervolgens naar fysieke robotbewegingen .
FLUX-mimic is getest en ingezet bij echte productietaken van Audi . Volgens de partners hielpen de robots bij complexe manipulatie van zachte materialen — werkzaamheden die met traditionele programmering volgens hen simpelweg niet uitvoerbaar waren . Het systeem zou bovendien minder demonstratiegegevens nodig hebben om nieuwe taken te leren dan bestaande benaderingen .
De samenwerking brengt de expertise van BFL op het gebied van visuele foundationmodellen samen met die van mimic robotics op het gebied van robotleren, zeer nauwkeurige manipulatie en inzet in productieomgevingen .
In discussies over het model circuleren specifieke cijfers van minder dan 80 milliseconden inferentie op één RTX 5090 en een systeemsreactietijd van 101 milliseconden. Die waarden komen echter niet voor in de beschikbare officiële publicaties van BFL, Bloomberg of de persberichten rond de lancering .
Ook de officiële BFL-blogposts en berichtgeving van 23 juli 2026 bevatten geen hardware-specifieke benchmarks voor deze prestaties . De cijfers kunnen afkomstig zijn uit een nog niet gepubliceerd technisch rapport, een analyse van derden of latere tests, maar op basis van de huidige bronnen zijn ze niet te verifiëren.
FLUX 3 is wel ontworpen met near-realtime robotbesturing in gedachten. Een officiële latencyspecificatie voor consumenten-GPU’s is tot nu toe niet gepubliceerd. Ter context: communitytests van oudere FLUX-modellen op een RTX 5090 rapporteren voor het genereren van een afbeelding doorgaans tijden van enkele seconden, afhankelijk van model, instellingen en optimalisaties . Dat is niet rechtstreeks vergelijkbaar met actievoorspelling, maar onderstreept wel dat een claim van minder dan 100 milliseconden voor robotacties afzonderlijk moet worden getest.
Toegang kan worden aangevraagd via het early-accessformulier van BFL op bfl.ai/models/flux-3 .