Videogenerering: FLUX 3 kan skabe videoklip på op til 20 sekunder med indbygget, synkroniseret lyd i én generering . Modellen understøtter tekst-til-video, billede-til-video, video-til-video, keyframe-til-video samt agentbaseret sammenkædning af flere klip . Outputtet kan nå 1080p ved 24 billeder i sekundet og omfatter blandt andet kontinuitet på tværs af flere scener og kamerastyring .
Lydgenerering: Lyd genereres samtidig med videoen. Det omfatter flersproget dialog og lydeffekter, der er koblet til begivenhederne i billedet . Outputtet er i 48 kHz stereo .
Billedgenerering og redigering: Modellen er udviklet til at generere og redigere billeder i forskellige stilarter, billedformater og opløsninger. BFL fremhæver også forbedret tekstgengivelse og bedre håndtering af komplekse instruktioner . Tidlig adgang til billedfunktionen skulle efter planen åbne »i de kommende uger« efter lanceringen .
Forudsigelse af robotbevægelser: FLUX 3’s forståelse af verden kan bruges til at forudsige, hvad en robot bør gøre som det næste. Det kan ske direkte eller via en finjusteret handlingsdekoder . Dermed kan den samme model fungere som fælles grundlag for både kreativ indholdsproduktion og fysisk robotstyring .
Én samlet arkitektur: FLUX 3 bygger på BFL’s Self-Flow-metode, som samordner multimodal generering og repræsentationslæring i samme ramme . BFL beskriver samtidig en interessant træningseffekt: Når forudsigelse af robotbevægelser tilføjes, falder videokvaliteten midlertidigt med op til 10 procent. Efter omkring 3.500 træningstrin genvinder modellen den fulde kvalitet, samtidig med at den bevarer evnen til at forudsige handlinger .
Black Forest Labs har samarbejdet med den schweiziske startup mimic robotics om at udvikle FLUX-mimic, en video-handlingsmodel baseret på FLUX 3 . Systemet træner en let handlingsdekoder på mellemrepræsentationer fra FLUX 3’s videoforløb. På den måde kan dekoderen udlede fysiske handlinger fra den verdensrepræsentation, som modellen allerede har lært .
FLUX-mimic er blevet testet og taget i brug på konkrete produktionsopgaver hos Audi . Ifølge partnerne har Audi brugt robotterne til komplekse opgaver med bløde og eftergivelige materialer, som traditionel programmering ifølge selskaberne ikke ville have kunnet løse .
Samarbejdet kombinerer BFL’s ekspertise i visuelle grundmodeller med mimic robotics’ erfaring inden for robotlæring, fingerfærdig manipulation og implementering i produktionen . Systemet skal desuden kunne lære nye opgaver med mindre demonstrationsdata end flere eksisterende metoder .
I onlinefora bliver der nogle gange nævnt konkrete tal på under 80 millisekunders inferens på ét RTX 5090-grafikkort og 101 millisekunders samlet systemreaktionstid. Disse tal fremgår imidlertid ikke af de tilgængelige officielle kilder fra BFL, Bloomberg eller de officielle pressemeddelelser .
BFL’s egne blogindlæg og den presseomtale, der blev offentliggjort på lanceringsdagen, indeholder heller ikke hardware-specifikke latency-målinger . Tallene kan derfor stamme fra en endnu ikke offentliggjort teknisk rapport, en tredjepartsanalyse eller senere test, men der er ikke tilstrækkeligt grundlag i det nuværende kildemateriale til at bekræfte dem.
Det er dokumenteret, at FLUX 3-systemet er designet med henblik på robotstyring tæt på realtid. BFL har dog endnu ikke offentliggjort en officiel latenstid for kørsel på almindelige forbruger-GPU’er.
Som sammenligning ligger billedgenerering med forgængeren FLUX.1 på et RTX 5090 typisk omkring 5-12 sekunder for et billede i 1024 × 1024 pixels, afhængigt af optimering. Bruger- og community-målinger for FLUX.2-dev ligger ligeledes i størrelsesordenen sekunder pr. billede . Video- og handlingsforudsigelse i FLUX 3 er dog væsentligt anderledes arbejdsbelastninger, så disse tal kan ikke bruges som direkte mål for robotstyring.
Adgang kan anmodes via BFL’s formular på bfl.ai/models/flux-3 .