Generación de vídeo: FLUX 3 puede crear clips de hasta 20 segundos con audio nativo sincronizado en una sola pasada . Admite generación de texto a vídeo, imagen a vídeo, vídeo a vídeo, de fotograma clave a vídeo y encadenamiento agéntico de múltiples clips . La salida alcanza resolución 1080p a 24 fps con consistencia entre planos y controles de cámara .
Generación de audio: el audio se genera de forma nativa junto con el vídeo, e incluye diálogos multilingües y efectos de sonido vinculados causalmente a los eventos visuales . La salida es estéreo de 48 kHz .
Generación y edición de imágenes: el modelo sintetiza y edita imágenes en diversos estilos, relaciones de aspecto y resoluciones, con un mejor renderizado de texto y manejo de instrucciones complejas . El acceso anticipado para generación de imágenes estaba previsto para "las próximas semanas" tras el lanzamiento .
Predicción de acciones: la comprensión del mundo de FLUX 3 se extiende a la predicción de acciones robóticas, ya sea de forma nativa o mediante un decodificador de acciones ajustado . Esta capacidad convierte al modelo en un backbone compartido tanto para la generación de contenido creativo como para el control físico de robots .
Arquitectura unificada: construida sobre el enfoque Self-Flow de BFL, que alinea la generación multimodal y el aprendizaje de representaciones en un solo marco . Un efecto secundario interesante: añadir la predicción de acciones reduce temporalmente la calidad del vídeo hasta en un 10%, pero el modelo recupera la calidad completa después de aproximadamente 3.500 pasos de entrenamiento, conservando la capacidad de predicción de acciones .
BFL se asoció con la startup suiza mimic robotics para desarrollar FLUX-mimic, un modelo de vídeo-acción construido sobre la base de FLUX 3 . El sistema entrena un decodificador de acciones ligero a partir de las características intermedias de la ruta de predicción de vídeo de FLUX 3, descodificando acciones físicas a partir de la representación del mundo aprendida por el modelo .
FLUX-mimic ha sido probado y desplegado en tareas de producción reales en Audi . Según los socios, Audi ha utilizado estos robots para resolver "tareas de manipulación de cuerpos blandos que habrían sido simplemente imposibles" con la programación tradicional . El sistema reduce la cantidad de datos de demostración necesarios para aprender nuevas tareas en comparación con los enfoques existentes . La asociación combina la experiencia de BFL en modelos fundacionales visuales con la capacidad de mimic en aprendizaje robótico, manipulación diestra y despliegue en producción .
Las cifras de latencia específicas que a veces se mencionan en foros —inferencia en menos de 80 ms en una sola GPU RTX 5090 y tiempo de reacción del sistema de 101 ms— no aparecen en las fuentes oficiales disponibles de BFL, Bloomberg ni en los comunicados de prensa oficiales . Las publicaciones oficiales del blog de BFL y la cobertura de prensa del día de lanzamiento (23 de julio de 2026) no incluyen estos puntos de referencia específicos de hardware .
Advertencia importante: estas cifras podrían proceder de un informe técnico no publicado, de un análisis de terceros o de pruebas posteriores, pero no hay pruebas suficientes en el conjunto actual de fuentes para verificarlas o citarlas. Como contexto, el sistema FLUX 3 en su conjunto está diseñado para un control robótico casi en tiempo real, pero BFL aún no ha publicado ninguna especificación oficial de latencia en GPUs de consumo.
A modo de comparación, en el modelo predecesor FLUX.1, una RTX 5090 genera una imagen de 1024×1024 en aproximadamente 5-12 segundos (dependiendo de la optimización), y los puntos de referencia comunitarios en FLUX.2-dev también reportan tiempos en el rango de segundos por imagen . Las cargas de trabajo de vídeo y predicción de acciones de FLUX 3 serán sustancialmente diferentes, pero la supuesta latencia inferior a 100 milisegundos para la inferencia de acciones aún no está confirmada por BFL.