BFL 同瑞士初創公司 mimic robotics 合作,開發咗 FLUX-mimic,呢個係一個建基於 FLUX 3 骨幹嘅影片-動作模型 。系統會從 FLUX 3 影片預測路徑嘅中間特徵,訓練一個輕量嘅動作解碼器,從模型學到嘅世界表徵入面解碼出實際動作 。
FLUX-mimic 已經喺 Audi 嘅真實生產任務上測試同部署 。合作夥伴話,Audi 用呢啲機械人解決咗「傳統程式根本冇可能做到嘅複雜軟性物料操作工作」。同現有方法相比,呢個系統學新任務需要嘅示範數據量大減 。呢次合作結合咗 BFL 嘅視覺基礎模型專長同 mimic 嘅機械人學習、靈巧操作同生產部署能力 。
網上討論區有時會講到一啲好誇張嘅數字,例如 單張 RTX 5090 GPU 上推理少過 80 毫秒、系統反應時間 101 毫秒。但係,呢啲數字喺 BFL 嘅官方博客、Bloomberg 報道、或者正式新聞稿入面係完全睇唔到嘅 。
重要提醒:呢啲效能數字可能係嚟自未公開嘅技術報告、第三方分析或者後續測試,但係根據現有資料,根本冇足夠證據去確認或者引用佢哋。成個 FLUX 3 系統係為咗接近實時嘅機械人控制而設計,但官方到目前為止都未公佈過任何關於消費級 GPU 嘅延遲規格。
作為參考,前代模型 FLUX.1 喺 RTX 5090 上生成一張 1024×1024 圖片大約需要 5 至 12 秒(視乎優化程度),而 FLUX.2-dev 嘅社區基準測試結果都係喺秒級範圍 。FLUX 3 嘅影片同動作預測工作量當然好唔同,但係官方未確認之前,坊間嗰啲少過 100 毫秒嘅延遲聲稱都係得個講字。