FLUX 3 може генерувати відеокліпи тривалістю до 20 секунд із нативно синхронізованим аудіо за один прохід . Модель підтримує кілька робочих сценаріїв:
Заявлені параметри виводу сягають роздільної здатності 1080p і частоти 24 кадри на секунду. Також заявлено узгодженість між кількома сценами та керування камерою .
Звук генерується разом із відео, а не додається окремим етапом. Він може містити багатомовні діалоги та звукові ефекти, причинно пов’язані з тим, що відбувається в кадрі . Заявлений формат — стерео 48 кГц .
Модель призначена не лише для відео: вона також створює та редагує зображення в різних стилях, форматах і роздільностях. BFL окремо наголошує на вдосконаленому відтворенні тексту в зображеннях і роботі зі складними описами .
Однак на момент запуску відеофункція була доступна першою. Ранній доступ до генерації зображень компанія планувала відкрити «найближчими тижнями» після презентації .
Ключова відмінність FLUX 3 від звичайних генераторів контенту — можливість використовувати її в робототехніці. Модель може прогнозувати, що робот має зробити далі, спираючись на побачене. Це може працювати безпосередньо або через донавчений декодер дій .
Так FLUX 3 стає спільною основою для двох напрямів: створення медіаконтенту та керування фізичними системами .
FLUX 3 побудована на підході Self-Flow, який поєднує мультимодальну генерацію та навчання внутрішніх представлень в одній архітектурі . Ідея полягає в тому, щоб зображення, відео та аудіо не оброблялися як повністю ізольовані типи даних.
BFL також описує цікавий компроміс під час навчання. Додавання прогнозування дій спочатку знижувало якість відео максимум на 10%. Приблизно після 3500 кроків навчання модель повертала повну якість відео, зберігаючи здатність прогнозувати дії .
Black Forest Labs співпрацює зі швейцарським стартапом mimic robotics над FLUX-mimic — відео-екшен-моделлю, побудованою на основі FLUX 3 .
Система використовує проміжні ознаки з відеопрогнозувального контуру FLUX 3. На них навчають легкий декодер дій, який перетворює засвоєне моделлю уявлення про світ на фізичні команди для робота .
За даними BFL і mimic robotics, FLUX-mimic уже тестували та впроваджували у реальних виробничих завданнях Audi . Партнери заявляють, що роботи виконували складні маніпуляції з гнучкими матеріалами — завдання, які, за їхньою оцінкою, було б «просто неможливо» розв’язати традиційним програмуванням .
Окремо наголошується, що для навчання нових завдань системі потрібно менше демонстраційних даних, ніж багатьом попереднім підходам . У партнерстві BFL відповідає за мультимодальну базову модель, а mimic robotics — за навчання роботів, точні маніпуляції та впровадження у виробничих умовах .
У спільноті обговорюються показники менше 80 мс для інференсу на одній відеокарті RTX 5090 і 101 мс системного часу реакції. Проте цих цифр немає в доступних офіційних матеріалах BFL, публікаціях Bloomberg чи пресрелізах партнерів .
Тому наразі немає достатніх підстав подавати їх як підтверджені характеристики FLUX 3. Вони можуть походити з неопублікованого технічного звіту, стороннього аналізу або пізніших тестів, але поточний набір джерел цього не підтверджує.
Загалом FLUX 3 створюють для керування роботами з близькою до реального часу реакцією, однак офіційної специфікації затримки для споживчих GPU BFL поки не оприлюднила.
Для порівняння: тести попередніх моделей FLUX на RTX 5090 показують, що генерація зображення 1024×1024 може тривати приблизно від 5 до 12 секунд залежно від оптимізації, а для FLUX.2-dev у спільноті також наводять результати в межах кількох секунд на зображення . Відеогенерація та прогнозування дій мають інше обчислювальне навантаження, тож ці цифри не можна безпосередньо переносити на FLUX 3.
Подати заявку на ранній доступ можна через форму на сторінці BFL: bfl.ai/models/flux-3 .
FLUX 3 важлива не лише як чергова модель для створення відео. Її головна особливість — спроба використати одну мультимодальну основу і для генеративного контенту, і для розуміння фізичного світу. Першим практичним доказом цього підходу стала FLUX-mimic, яку вже тестують у виробничих сценаріях Audi.
Водночас гучні заяви про затримку менш як 100 мс поки не мають офіційного підтвердження. Тому на цьому етапі FLUX 3 варто сприймати як перспективну платформу в ранньому доступі, а не як повністю розкритий і незалежно підтверджений стандарт для робототехніки.