動画生成 — FLUX 3は、一度の生成で最大20秒の動画を、ネイティブな同期音声とともに出力できます 。対応ワークフローはテキスト→動画、画像→動画、動画→動画、キーフレーム→動画、さらに複数クリップのエージェント的連結にも対応 。出力解像度は1080p、24fpsで、マルチショットの一貫性やカメラ制御も可能です 。
音声生成 — 動画と同時に音声もネイティブ生成。多言語対応のダイアログや、映像イベントに因果的に関連づけられた効果音が48kHzステレオで出力されます 。
画像生成・編集 — 多様なスタイル、アスペクト比、解像度に対応し、テキストレンダリングや複雑なプロンプト処理も改善されました 。画像生成の早期アクセスは、発表後「数週間以内」に開始予定とされています 。
動作予測 — FLUX 3の世界理解はロボットの動作予測にも拡張可能で、ネイティブまたはファインチューニングされたアクションデコーダーを通じて物理動作を予測します 。これにより、クリエイティブコンテンツ生成と物理ロボット制御の両方に対応する共有バックボーンとして機能します 。
統一アーキテクチャ — BFLの「Self-Flow」アプローチに基づき、マルチモーダル生成と表現学習を単一フレームワークで統合しています 。興味深い副作用として、動作予測を追加すると動画品質が最大10%低下しますが、約3,500トレーニングステップ後には動作予測能力を維持したまま完全に品質が回復します 。
BFLはスイスのスタートアップ mimic robotics と協力し、FLUX 3をバックボーンとするビデオアクションモデル FLUX-mimic を開発しました 。このシステムは、FLUX 3の動画予測パスの中間特徴量から軽量なアクションデコーダーをトレーニングし、モデルが学習した世界表現から物理的な動作をデコードします 。
FLUX-mimicは、Audiの実際の生産ラインでテスト・導入済み です 。パートナー企業の発表によれば、Audiはこれらのロボットを使って「従来のプログラミングではまったく不可能だった複雑な柔軟物のマニピュレーション作業」を解決したとされています 。このシステムは、既存の手法と比較して新しいタスクを学習するために必要なデモデータの量を大幅に削減します 。このパートナーシップは、BFLのビジュアル基盤モデルの専門知識と、mimicのロボット学習・巧みなマニピュレーション・生産導入の能力を組み合わせたものです 。
コミュニティフォーラムなどで時折話題になる 「RTX 5090で80ms未満の推論」 や 「101msのシステム反応時間」 といった具体的なレイテンシ数値は、BFLやBloombergの公式発表、プレスリリースのいずれにも記載されていません 。2026年7月23日のローンチ時点のBFL公式ブログや報道では、これらのハードウェア固有のベンチマークは含まれていません 。
重要な注意点:これらの数値は未公開のテクニカルレポートやサードパーティの分析、あるいは後日のテストに由来する可能性がありますが、現時点のソースセットでは検証または引用するための十分なエビデンスがありません。参考までに、FLUX 3システム全体はニアリアルタイムのロボット制御向けに設計されていますが、コンシューマーGPUでの公式レイテンシ仕様はまだ公開されていません。
比較として、前世代のFLUX.1では、RTX 5090で1024×1024の画像生成に約5~12秒(最適化に依存)かかり、FLUX.2-devでも1画像あたり秒単位の時間がかかるとコミュニティベンチマークで報告されています 。FLUX 3の動画生成や動作予測のワークロードはこれらとは大幅に異なりますが、主張されている100ミリ秒未満のアクション推論レイテンシはBFLによってまだ確認されていません。