视频生成——FLUX 3 可一次生成最长20秒、带原生同步音频的视频片段 。支持文本转视频、图像转视频、视频转视频、关键帧转视频,以及多片段智能串联 。输出分辨率达1080p、24fps,具备多镜头一致性和相机控制功能 。
音频生成——音频与视频原生同步生成,包括多语言对话和与画面事件因果关联的音效 。输出为48kHz立体声 。
图像生成与编辑——支持多种风格、宽高比和分辨率下的图像合成与编辑,改进了文字渲染和复杂提示词处理能力 。图像生成功能的早期访问将在发布后“数周内”开放 。
动作预测——FLUX 3 的世界理解能力可直接或通过微调的动作解码器延伸至机器人动作预测 。这使得同一模型既能用于创意内容生成,也能用于机器人物理控制 。
统一架构——基于 BFL 的 Self-Flow 方法,在单一框架内对齐多模态生成与表征学习 。一个有趣的技术细节:加入动作预测能力会导致视频质量暂时下降约10%,但模型大约在3500个训练步后就能恢复完整画质,同时保留动作预测功能 。
BFL 与瑞士初创公司 mimic robotics 合作,在 FLUX 3 基础上打造了 FLUX-mimic——一个视频-动作模型 。该系统在 FLUX 3 视频预测路径的中间特征上训练了一个轻量级的动作解码器,从模型学到的世界表征中解码物理动作 。
FLUX-mimic 已在奥迪的真实生产任务中完成测试和部署 。据合作方透露,奥迪使用这些机器人完成了“传统编程根本无法实现的复杂软体操作工作” 。与传统方法相比,该系统学习新任务所需的示范数据量显著减少 。这一合作结合了 BFL 的视觉基础模型专长与 mimic 在机器人学习、灵巧操作和生产部署方面的能力 。
重要提示:社区论坛中流传的在单张RTX 5090 GPU上推理延迟低于80毫秒、系统反应时间101毫秒等具体数据,并未出现在BFL官方博客、彭博社或官方新闻稿中 。BFL 官方博客和2026年7月23日发布当天的媒体报道均未包含这些针对特定硬件的基准测试数据 。
这些数字可能来自未发布的技术报告、第三方分析或后续测试,但现有资料中没有充分证据可以验证或引用它们。作为参考,FLUX 3 整体系统设计目标是接近实时的机器人控制,但目前官方尚未公布任何消费级 GPU 上的延迟规格。
对比前代模型:在 FLUX.1 上,RTX 5090 生成一张1024×1024图像大约需要5–12秒(取决于优化程度);FLUX.2-dev 的社区测试也报告每张图像在数秒级别 。FLUX 3 的视频和动作预测负载会有所不同,但 BFL 尚未确认其动作推理能在100毫秒内完成。