Generazione video. FLUX 3 può creare, in un’unica elaborazione, clip fino a 20 secondi con audio sincronizzato nativo . Supporta diversi flussi di lavoro: testo-video, immagine-video, video-video, fotogramma chiave-video e concatenazione di più clip tramite workflow agentici . Le informazioni disponibili indicano output fino a 1080p e 24 fotogrammi al secondo, oltre a coerenza tra più inquadrature e controlli della videocamera .
Generazione audio. L’audio viene prodotto insieme al video, anziché essere aggiunto in un secondo momento. Comprende dialoghi multilingue ed effetti sonori collegati causalmente agli eventi visivi, con output stereo a 48 kHz .
Generazione e modifica delle immagini. Il modello è progettato per sintetizzare e modificare immagini in stili, proporzioni e risoluzioni differenti, con miglioramenti nella resa del testo e nella gestione di prompt complessi . Al momento del lancio, tuttavia, l’accesso alla generazione di immagini non era ancora disponibile: BFL lo aveva indicato come previsto «nelle settimane successive» .
Previsione delle azioni. La rappresentazione del mondo appresa da FLUX 3 può essere utilizzata per prevedere le azioni robotiche, direttamente oppure tramite un decoder addestrato ad hoc . In questo modo, la stessa base tecnologica può sostenere sia applicazioni creative sia sistemi di controllo per robot fisici .
FLUX 3 si basa sull’approccio Self-Flow di Black Forest Labs, pensato per allineare generazione e comprensione multimodale nello stesso framework . L’idea è che immagini, video e audio non vengano trattati come compartimenti separati, ma contribuiscano a una rappresentazione condivisa del mondo.
Secondo BFL, l’aggiunta della previsione delle azioni può ridurre temporaneamente la qualità video fino al 10%. Dopo circa 3.500 passaggi di addestramento, però, il modello recupera la qualità iniziale mantenendo le capacità di previsione delle azioni .
Black Forest Labs ha collaborato con la startup svizzera mimic robotics allo sviluppo di FLUX-mimic, un modello video-azione costruito sulla base di FLUX 3 . Il sistema utilizza un decoder leggero addestrato sulle caratteristiche intermedie del percorso di previsione video di FLUX 3. Queste caratteristiche vengono poi convertite in azioni fisiche, sfruttando la rappresentazione del mondo già appresa dal modello .
FLUX-mimic è stato testato e utilizzato in attività produttive reali presso Audi . Secondo i partner, i robot sono riusciti a svolgere operazioni complesse di manipolazione di oggetti deformabili, attività che con la programmazione tradizionale sarebbe stata «semplicemente impossibile» .
La collaborazione unisce l’esperienza di BFL nei modelli visivi fondativi con le competenze di mimic robotics nell’apprendimento robotico, nella manipolazione ad alta destrezza e nell’impiego di robot in produzione . Il sistema, inoltre, richiede una quantità inferiore di dati dimostrativi per apprendere nuovi compiti rispetto ad alcuni approcci esistenti .
Online sono circolate cifre secondo cui FLUX 3 raggiungerebbe un tempo di inferenza inferiore a 80 millisecondi su una singola GPU NVIDIA RTX 5090 e un tempo di reazione del sistema pari a 101 millisecondi. Questi valori, però, non compaiono nelle fonti ufficiali disponibili di Black Forest Labs, né nella copertura del lancio consultata .
Potrebbero provenire da un rapporto tecnico non ancora pubblicato, da analisi di terze parti o da test successivi, ma allo stato attuale non ci sono elementi sufficienti per verificarli. BFL descrive il sistema come destinato al controllo robotico quasi in tempo reale, senza aver pubblicato una specifica ufficiale sulla latenza con GPU consumer.
Come termine di paragone, i test disponibili sui precedenti modelli FLUX.1 e FLUX.2-dev con una RTX 5090 riportano in genere tempi nell’ordine dei secondi per immagine, variabili in base a modello, ottimizzazioni e configurazione . I carichi di lavoro video e di previsione delle azioni sono naturalmente diversi, ma questo non basta a confermare una latenza inferiore ai 100 millisecondi per l’inferenza robotica di FLUX 3.
Le richieste di accesso possono essere presentate attraverso il modulo di accesso anticipato di BFL all’indirizzo bfl.ai/models/flux-3 .