Генерация видео — FLUX 3 может создавать видеоклипы длиной до 20 секунд со встроенным синхронизированным аудио за один проход . Поддерживаются форматы «текст в видео», «изображение в видео», «видео в видео», «по ключевым кадрам», а также агентная сборка нескольких клипов . Разрешение — до 1080p при 24 кадрах в секунду, с мультикадровой согласованностью и управлением камерой .
Генерация аудио — звук создаётся одновременно с видео, включая многоязычные диалоги и звуковые эффекты, привязанные к визуальным событиям . Выходной формат — 48 кГц, стерео .
Генерация и редактирование изображений — модель синтезирует и редактирует изображения в разных стилях, соотношениях сторон и разрешениях, с улучшенным рендерингом текста и обработкой сложных запросов . Ранний доступ к генерации изображений был обещан «в ближайшие недели» после запуска .
Предсказание действий — понимание мира, полученное FLUX 3, распространяется на прогнозирование движений роботов, как напрямую, так и через дообученный декодер действий . Это превращает модель в единую основу как для творческой генерации контента, так и для физического управления роботами .
Единая архитектура — построена на подходе Self-Flow от BFL, который объединяет мультимодальную генерацию и обучение представлениям в одном фреймворке . Интересный побочный эффект: добавление предсказания действий временно снижает качество видео примерно на 10%, но модель полностью восстанавливает его примерно через 3 500 шагов обучения, сохраняя при этом способность предсказывать действия .
BFL объединилась со швейцарским стартапом mimic robotics для разработки FLUX-mimic — модели «видео-действие», построенной на основе FLUX 3 . Система обучает лёгкий декодер действий на промежуточных признаках из тракта предсказания видео FLUX 3, декодируя физические действия из изученного моделью представления мира .
FLUX-mimic была протестирована и внедрена на реальных производственных задачах на Audi . По словам партнёров, Audi использует этих роботов для выполнения «сложных манипуляций с мягкими телами, которые были бы просто невозможны» при традиционном программировании . Система значительно сокращает объём демонстрационных данных, необходимых для обучения новым задачам, по сравнению с существующими подходами . Партнёрство объединяет экспертизу BFL в области визуальных фундаментальных моделей с опытом mimic в обучении роботов, ловких манипуляциях и производственном внедрении .
Конкретные показатели задержки, которые иногда обсуждаются в сообществах — менее 80 мс на одном GPU RTX 5090 и время реакции системы 101 мс — отсутствуют в официальных источниках BFL, Bloomberg или пресс-релизах . Официальные блог-посты BFL и освещение в прессе в день запуска (23 июля 2026 года) не содержат этих аппаратных бенчмарков .
Важное примечание: эти цифры могут быть из ещё не опубликованного технического отчёта, стороннего анализа или более поздних тестов, но в текущем наборе источников недостаточно доказательств, чтобы их проверить или цитировать. Для контекста: система FLUX 3 в целом спроектирована для работы, близкой к реальному времени, но официальных спецификаций задержки на потребительских GPU пока опубликовано не было.
Для сравнения: на предшественнике FLUX.1 RTX 5090 генерирует изображение 1024×1024 примерно за 5–12 секунд (в зависимости от оптимизации), а тесты сообщества на FLUX.2-dev также сообщают о времени в диапазоне секунд на изображение . Нагрузка FLUX 3 при генерации видео и предсказании действий будет существенно отличаться, но заявленная задержка менее 100 миллисекунд для вывода действий пока не подтверждена BFL.