Videogenerering: FLUX 3 kan skapa videoklipp på upp till 20 sekunder med synkroniserat ljud i samma generering . Den stöder text-till-video, bild-till-video, video-till-video, nyckelbild-till-video och så kallad agentisk kedjning, där flera klipp länkas ihop . Enligt tillgängliga uppgifter kan resultatet nå 1080p i 24 bilder per sekund, med kontroll över kamera och kontinuitet mellan flera scener .
Ljudgenerering: Ljudet skapas tillsammans med videon. Det omfattar bland annat flerspråkig dialog och ljudeffekter som kopplas till händelserna i bilden . Utdata anges vara stereoljud i 48 kHz .
Bildgenerering och redigering: Modellen kan skapa och redigera bilder i många stilar, bildformat och upplösningar. BFL lyfter även fram förbättrad textrendering och bättre hantering av komplexa instruktioner . Bildfunktionen var dock inte fullt tillgänglig vid lanseringen; tidig åtkomst utlovades ”under de kommande veckorna” .
Förutsägelse av robotiska handlingar: FLUX 3:s omvärldsförståelse kan användas för att förutsäga vilka handlingar en robot bör utföra, antingen direkt eller via en finjusterad handlingsavkodare . Det är denna del som gör modellen relevant för så kallad fysisk AI – system som inte bara producerar innehåll utan också kan påverka den fysiska världen.
En gemensam arkitektur: FLUX 3 bygger på BFL:s Self-Flow-metod, som ska förena multimodal generering och representationinlärning i samma ramverk . Enligt BFL:s beskrivning sjunker videokvaliteten tillfälligt med upp till 10 procent när handlingsförutsägelse läggs till. Efter ungefär 3 500 träningssteg återhämtar modellen den fulla kvaliteten samtidigt som den behåller förmågan att förutsäga handlingar .
Black Forest Labs har samarbetat med det schweiziska startupföretaget mimic robotics kring FLUX-mimic, en video-till-handling-modell som bygger på FLUX 3:s grundmodell . Systemet använder en lättare handlingsavkodare som tränas på mellanrepresentationer från FLUX 3:s videoförutsägelse. På så sätt kan den översätta modellens inlärda representation av omvärlden till fysiska robotrörelser .
FLUX-mimic har testats och använts i verkliga produktionsuppgifter hos Audi . Enligt samarbetspartnerna har Audi använt robotarna för komplexa uppgifter med mjuka och formföränderliga material – uppgifter som de beskriver som mycket svåra eller tidigare omöjliga att lösa med traditionell programmering .
Samarbetet kombinerar BFL:s expertis inom visuella grundmodeller med mimic robotics kompetens inom robotinlärning, finmotorisk manipulation och användning i produktion . Systemet ska också behöva färre demonstrationsdata för att lära sig nya uppgifter jämfört med befintliga metoder .
Det finns uppgifter i vissa forum om under 80 millisekunders inferens på ett enda RTX 5090-kort och 101 millisekunders total reaktionstid. De siffrorna finns dock inte i de tillgängliga officiella källorna från BFL, Bloomberg eller de officiella pressmeddelandena . BFL:s egna inlägg och rapporteringen från lanseringsdagen den 23 juli 2026 innehåller inga sådana hårdvaruspecifika mätningar .
Det är därför inte möjligt att bekräfta siffrorna utifrån det nuvarande källunderlaget. De kan komma från en ännu inte publicerad teknisk rapport, en tredjepartsanalys eller senare tester, men det saknas tillräckliga belägg för att ange dem som officiella prestanda.
Den övergripande FLUX 3-arkitekturen är avsedd för robotstyrning nära realtid, men BFL har ännu inte publicerat någon officiell latensspecifikation för konsumentgrafikkort.
Som jämförelse tar föregångaren FLUX.1 ungefär 5–12 sekunder på ett RTX 5090 för att skapa en bild i 1024 × 1024 pixlar, beroende på optimering. Community-tester av FLUX.2-dev visar också genereringstider på flera sekunder per bild . Videogenerering och handlingsförutsägelse har andra beräkningskrav, så jämförelsen är inte direkt. Men ett påstående om handlingsinferens under 100 millisekunder är alltså fortfarande obekräftat av BFL.
Intresseanmälan till den tidiga åtkomsten kan göras via BFL:s formulär på bfl.ai/models/flux-3 .