| 是否需要傳統重新訓練 | 不需要;新技能在推理階段取得,沒有任務專屬參數更新。 | 單次提示不需要梯度更新或微調;較困難的任務則可選擇少樣本梯度適配。 |
| 任務覆蓋 | 50 項訓練階段未見過的操作任務,涵蓋不同物件、工具與操作原語,每項任務進行 20 次試驗。 | 公開示範包括開罐、拉開拉鍊袋、把物件掃入碗中、將麥克筆放入杯中、倒螺栓,以及工具使用與即興操作等;目前沒有公開同等規格的完整任務測試套件。 |
| 單次示範成功率 | 平均 62%。 | Generalist AI 公開資料報告,在 10 項多樣化操作任務上平均為 59%;但尚缺乏獨立重現與統一測試協定。 |
| 基準與額外適配 | 研究團隊稱,表現比最強的零樣本模仿基準高 45%,也超過每項任務使用 50 段機器人示範進行監督式微調的方案。 | 若單次提示不足,Generalist AI 稱可用 1 至 5 分鐘資料進行 1 至 10 次梯度更新,約相當於 10 至 50 段示範。 |
| 效率主張 | 相較於每項任務使用 50 段機器人示範的監督式微調,技能取得速度約快 507 倍,所需示範資料約減少 50 倍。 | 以數秒級物理提示取代傳統任務訓練;需要時則以少量梯度更新完成適配。這些比較目前主要是公司主張,尚非獨立基準測試結果。 |
HOST 的重點不只是把人類影片轉換成機器人手臂的動作軌跡。不同機器人的身體結構、攝影機角度、手臂長度與抓取器都可能不同,直接逐幀模仿往往難以可靠轉移。
HOST 改為追蹤「任務進度」。系統會把人類影片中的操作階段,與機器人當下的視覺觀測及本體狀態對齊;接著預測如果機器人朝示範目標前進,從自身視角應該看到什麼結果,再反推出需要採取的動作。
因此,影片比較像一份持續更新的執行指南,而不是一組必須重新訓練模型的資料。由於模型參數在推理階段保持不變,研究團隊也主張它能避免傳統微調常見的「學新忘舊」問題。
在 50 項新操作任務、每項 20 次試驗的測試中,HOST 平均成功率為 62%。這表示方法確實能跨越不同物件、工具與操作原語轉移技能,但也同時說明它距離「任何任務都能可靠完成」仍有相當距離。
研究團隊另外測試了環境變化與干擾:在光線、物件、場景及人類干擾等條件改變下,表現相對基準的下降幅度分別約為 1%、4%、6% 與 9%。這些結果顯示系統具備一定韌性,但仍屬受控實驗環境中的結果。
GEN-1.5 採用更大型、較通用的具身模型路線。Generalist AI 表示,模型透過超過 8 個月的真實物理互動訓練,建立對物件、動作與環境反應的廣泛先驗知識;當使用者提供一段 3 至 12 秒的示範時,模型不必先更新權重,而是把影片放入上下文中,立即嘗試執行任務。
GEN-1.5 的公開資料報告,在 10 項多樣化操作任務上,單次示範平均成功率為 59%。不過,這項數字與任務內容主要來自公司及其公開宣傳材料,目前尚未有與 HOST 相同程度的完整任務清單、試驗次數、基準比較、模型發布或第三方重現,因此不宜直接把兩者的成功率視為可完全對照的指標。
此外,GEN-1.5 並非在所有情況下都「完全不訓練」。單次物理提示不需要梯度更新,但對較困難的任務,Generalist AI 提供少樣本適配路徑,以數分鐘資料和 1 至 10 次梯度更新改善結果。這仍遠少於傳統的大規模任務訓練,但概念上已不再是嚴格意義的零更新學習。
兩項成果共同指向一種更直覺的人機互動方式:與其逐行撰寫程式、設計獎勵函數,或為每項任務收集數百段機器人示範,不如直接示範一次。
人類學習新工作時,通常不需要從零開始建立整套身體控制能力;我們會運用既有的物理常識,再從他人的示範中理解這次的目標、步驟與關鍵互動。HOST 與 GEN-1.5 嘗試把類似的分工帶進機器人系統:
這也是為什麼「單段影片學習」的效率主張值得關注。不過,真正被省下的不是所有訓練成本,而是新使用者面對每項新任務時所需的額外訓練成本。基礎模型仍然需要大量資料、運算與時間;只是這些成本先被攤提,之後才能讓個別任務以數秒示範開始嘗試。HOST 的平均 29 秒取得時間,以及相較傳統微調快約 507 倍的主張,正是這種成本轉移的具體例子。
HOST 的 62% 成功率來自研究團隊設計的 50 項新操作任務與受控實驗。這是相當具體的證據,但尚不能直接推論到家庭環境、複雜工業現場、長時間多步驟任務或安全關鍵情境。更廣泛的獨立複製與真實部署表現,仍待驗證。
GEN-1.5 的模型能力、訓練時間、不使用模擬資料、示範時長與適配方式,主要由 Generalist AI 或轉述其公告的資料提出。目前公開資訊不足以確認一套標準化的任務數量、試驗流程、整體單次示範成功率、基準模型、資料與模型發布狀態,或第三方重現結果。
因此,GEN-1.5 的示範可視為具有潛力的能力證據,但還不能被視為已經獨立驗證的機器人性能新標竿。
綜合來看,HOST 提供了較明確的學術證據,說明機器人可以在一段人類影片的引導下,於推理階段取得新操作技能,而且不必更新任務專屬參數。GEN-1.5 則展示另一種可能:當具身模型累積足夠廣泛的真實世界預訓練後,單次示範或許能成為大型通用模型自然浮現的上下文能力。
這兩項成果確實支持機器人學習從「為每項任務重新訓練」轉向「看示範、即時模仿」。但目前更準確的結論是:**觀察式機器人學習正在成形,而不是已經取代任務驗證、安全工程與受控適配。**在不受約束的環境中,成功率、錯誤復原、安全邊界與長期穩定性,仍是這條技術路線必須回答的問題。