這次測試還包括直播以及一場「人類 vs 機械人」的實戰比賽,成為目前最接近真實物流工作的機械人基準案例之一。
測試在 Figure AI 位於 Sunnyvale(矽谷附近) 的設施內進行。原本只是短時間示範,但因為系統表現穩定,最後延長成為一場長達多天的耐力測試。
主要結果包括:
有報導列出最終數字為 249,558 件,亦有資料提到 249,560 件,因此通常會以「接近 25 萬件」描述。
不過數據並非完全一致:另一來源曾提到 149,000+ 件包裹,顯示直播過程中不同報導對總數的統計略有差異。
即使如此,測試仍顯示這些機械人可以 連續一星期以上執行倉庫工作,而且不需要遠端人工操控。
這次測試的核心指標是 吞吐量(throughput)。
Figure AI 之前表示,他們的物流系統已經接近 「人類水平」速度:平均 每件包裹少於 3 秒。
在示範中,機械人大致會完成以下流程:
能夠在 幾十萬件包裹 的規模下維持約 3 秒一件 的速度,意味這不只是短時間爆發速度,而是接近真正生產環境的持續效率。
F.03 的能力很大程度來自 Figure 自家開發的 Helix‑02 AI 系統。
Helix‑02 屬於 Vision‑Language‑Action(VLA)模型——一種把感知、理解與動作控制整合在同一神經網絡架構的系統。
換句話說,系統會:
Figure 把這種方式形容為 「pixels‑to‑actions」(由影像直接生成動作)。
在物流場景中,這意味機械人可以處理不同形態的包裹,例如:
並且自動調整抓取方式、翻轉包裹、找到條碼位置再完成掃描。
為了更直接比較效率,Figure 還安排了一場 10 小時的人機對決。
參賽者包括:
兩者的任務完全相同:掃描包裹條碼並放到正確輸送帶。
最終成績:
人類只贏了 192 件包裹,差距大約 1.3%。
換句話說,在整整一個工作班次內,機械人的速度已經 幾乎與人類相同。
人形機械人示範其實多年來都有,但很多只是持續幾分鐘或幾小時。
Figure 這次測試之所以受到關注,主要因為三個原因:
1. 長時間耐力
能夠 200 小時連續運作,顯示機械結構與控制系統已具備長時間工作的穩定性。
2. 接近人類效率
平均 約 3 秒處理一件包裹,已經接近倉庫員工的實際工作速度。
3. 真正自主運作
測試過程中據稱沒有遠端操作,而是完全由 AI 系統控制。
這些因素結合起來,意味人形機械人正逐漸從「展示技術」走向 具商業價值的物流工作。
即使數據看起來很亮眼,目前的證據仍然主要來自 Figure 自家的示範和直播測試,而不是大規模獨立部署。
因此更合理的理解是:
這次測試展示的是 技術進步的證據,而不是證明機械人已準備好全面取代倉庫員工。
不過,人類與機械人在物流任務中的差距,如今已經縮小到 每件包裹幾百分之一秒的速度差——這個變化,本身已經相當值得注意。