影片生成——FLUX 3 能在單次生成中,產生長達 20 秒、附帶原生同步音訊的影片剪輯 。它支援文字轉影片、圖片轉影片、影片轉影片、關鍵幀轉影片,以及多個剪輯的代理鏈式生成 。輸出解析度可達 1080p、24 fps,並具備多鏡頭一致性與攝像機控制功能 。
音頻生成——音頻會與影片同步原生生成,包括多語言對話以及與視覺事件因果相關的音效 。輸出為 48 kHz 立體聲 。
圖片生成與編輯——模型能合成與編輯多種風格、長寬比和解析度的圖片,並改善文字渲染與複雜提示的處理能力 。BFL 表示,圖像生成的早期存取將在發布後「數週內」開放 。
動作預測——FLUX 3 的世界理解能力可延伸至預測機器人動作,無論是原生方式或透過微調的動作解碼器 。這項能力將模型轉變為一個共享骨幹,既能用於創意內容生成,也能用於實體機器人控制 。
統一架構——基於 BFL 的 Self-Flow 方法,在單一架構中對齊多模態生成與表徵學習 。一個有趣的副作用是:加入動作預測功能會導致影片品質暫時下降約 10%,但模型在約 3,500 個訓練步驟後會恢復全部品質,同時保留動作預測能力 。
BFL 與瑞士新創公司 mimic robotics 合作,開發基於 FLUX 3 骨幹的 FLUX-mimic 影片動作模型 。該系統在 FLUX 3 影片預測路徑的中間特徵上訓練一個輕量級動作解碼器,從模型學到的世界表徵中解碼出物理動作 。
FLUX-mimic 已在 Audi 的真實生產任務中進行測試並部署 。合作夥伴表示,Audi 使用這些機器人來解決「傳統程式設計完全無法處理的複雜軟性物體操作工作」。與現有方法相比,該系統能大幅減少學習新任務所需的示範數據量 。這項合作結合了 BFL 在視覺基礎模型方面的專業知識,以及 mimic 在機器人學習、靈巧操作與生產部署方面的能力 。
社群論壇中偶爾討論的特定延遲數據——在單張 RTX 5090 GPU 上推理時間低於 80 毫秒 以及 101 毫秒的系統反應時間——並未出現在 BFL、彭博社或官方新聞稿的現有公開來源中 。BFL 官方部落格文章及發布日(2026 年 7 月 23 日)的新聞報導均未包含這些硬體特定基準 。
重要警示:這些數據可能來自一份尚未公開的技術報告、第三方分析或後續測試,但在目前的資料集中缺乏足夠證據加以驗證或引用。作為背景資訊,整體 FLUX 3 系統是為接近即時的機器人控制而設計,但官方尚未公布消費級 GPU 上的延遲規格。
作為對比,在其前代模型 FLUX.1 上,一張 RTX 5090 生成一張 1024×1024 圖片大約需要 5 到 12 秒(視優化情況而定),而 FLUX.2-dev 的社群基準測試也顯示每張圖片的生成時間在秒級 。FLUX 3 的影片和動作預測工作負載將有顯著不同,但 BFL 尚未確認宣稱的動作推理延遲低於 100 毫秒的說法。