Génération vidéo — FLUX 3 peut générer des clips vidéo allant jusqu’à 20 secondes avec un audio natif synchronisé en une seule passe . Il prend en charge le texte vers vidéo, l’image vers vidéo, la vidéo vers vidéo, l’image clé vers vidéo, et le chaînage agentique de plusieurs clips . La sortie atteint une résolution 1080p à 24 im/s avec une cohérence multi-plan et des contrôles de caméra .
Génération audio — L’audio est produit nativement avec la vidéo, incluant des dialogues multilingues et des effets sonores liés de manière causale aux événements visuels . La sortie est en stéréo 48 kHz .
Génération et édition d’images — Le modèle synthétise et édite des images dans divers styles, formats et résolutions, avec un rendu de texte amélioré et une gestion de prompts complexes . L’accès anticipé pour la génération d’images était prévu « dans les semaines suivant le lancement » .
Prédiction d’actions — La compréhension du monde de FLUX 3 s’étend à la prédiction d’actions robotiques, soit nativement, soit via un décodeur d’actions affiné . Cette capacité transforme le modèle en un socle partagé à la fois pour la génération de contenu créatif et le contrôle de robots physiques .
Architecture unifiée — Construite sur l’approche Self-Flow de BFL, qui aligne la génération multimodale et l’apprentissage de représentations dans un même cadre . Un effet secondaire intéressant : l’ajout de la prédiction d’actions réduit temporairement la qualité vidéo jusqu’à 10 %, mais le modèle retrouve sa pleine qualité après environ 3 500 étapes d’entraînement tout en conservant ses capacités de prédiction d’actions .
BFL s’est associé à la startup suisse Mimic Robotics pour développer FLUX-mimic, un modèle vidéo-action basé sur l’architecture de FLUX 3 . Le système entraîne un décodeur d’actions léger sur les caractéristiques intermédiaires du chemin de prédiction vidéo de FLUX 3, décodant les actions physiques à partir de la représentation apprise du monde par le modèle .
FLUX-mimic a été testé et déployé sur des tâches de production réelles chez Audi . Selon les partenaires, Audi a utilisé ces robots pour résoudre des « travaux de manipulation de corps mous complexes qui auraient été tout simplement impossibles » avec une programmation traditionnelle . Le système réduit la quantité de données de démonstration nécessaires pour apprendre de nouvelles tâches par rapport aux approches existantes . Le partenariat combine l’expertise de BFL en matière de modèles de fondation visuelle avec le savoir-faire de Mimic en apprentissage robotique, manipulation dextre et déploiement en production .
Les chiffres de latence spécifiques parfois évoqués dans les forums — inférence sous 80 ms sur un seul GPU RTX 5090 et temps de réaction système de 101 ms — n’apparaissent pas dans les sources officielles disponibles de BFL, Bloomberg ou des communiqués de presse officiels . Les articles de blog officiels de BFL et la couverture médiatique du jour du lancement (23 juillet 2026) ne contiennent pas ces benchmarks matériels spécifiques .
Avertissement important : Ces chiffres peuvent provenir d’un rapport technique non publié, d’une analyse tierce ou de tests ultérieurs, mais il n’y a pas suffisamment de preuves dans l’ensemble des sources actuelles pour les vérifier ou les citer. Pour contextualiser, le système FLUX 3 dans son ensemble est conçu pour un contrôle robotique proche du temps réel, mais aucune spécification de latence officielle sur des GPU grand public n’a encore été publiée.
À titre de comparaison, sur le modèle précédent FLUX.1, un RTX 5090 génère une image 1 024 × 1 024 en environ 5 à 12 secondes (selon l’optimisation), et les benchmarks de la communauté sur FLUX.2-dev rapportent également des temps de l’ordre de la seconde par image . Les charges de travail de prédiction vidéo et d’actions de FLUX 3 seront sensiblement différentes, mais la latence inférieure à 100 millisecondes revendiquée pour l’inférence d’actions n’est pas encore confirmée par BFL.