HOST 與 GEN 1.5 都將人類示範影片當成推理時的「上下文提示」,而不是每次都重新訓練一個新模型。 HOST 在 50 項未見過的操作任務中,平均成功率為 62%,平均約 29 秒便可取得新技能,學習速度據報較每項任務用 50 段機械人示範微調快約 507 倍。[1][3] GEN 1.5 由 Generalist AI 聲稱可用 3 至 12 秒單次示範即時執行新任務;公司亦報稱在 10 項多元操作任務中,單次示範平均成功率為 59%,但目前缺乏同等規模的獨立驗證。[1][26]
研究答案

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
機械人學新技能,傳統上往往要為每項新任務收集大量機械人數據,再進行專項微調。HOST 和 Generalist AI 的 GEN-1.5 採取另一條路:預先訓練好的系統把一段很短的人類示範當成即時上下文,理解「要做甚麼」和「做到哪一步」,然後直接控制機械人執行。
簡單講,使用者不必逐行寫程式,也不一定要重新跑一次完整訓練流程;示範一次,機械人便嘗試照做。不過,兩者的研究定位、架構細節和證據強度都有明顯差異:HOST 的學術實驗較完整,GEN-1.5 則主要依靠 Generalist AI 自行公布的結果。
HOST 並不是簡單地把人手的絕對軌跡逐格翻譯成機械人動作。它會將人類影片視為一個按任務進度排列的參考,判斷機械人目前進行到哪個階段,再從機械人自身的視角預測下一步應達到的結果,最後反推出所需動作。
這種設計的關鍵,在於機械人不必完全複製示範者的手臂位置或動作速度。即使機械人的身體結構、視角或執行路徑不同,系統仍嘗試對齊「任務進度」及「預期結果」。因此,短片不是一份新的訓練數據,而是一次即時引導。
研究團隊在 50 項未見過的操作任務、每項 20 次試驗中,錄得 62% 平均成功率。 測試涵蓋不同物件、工具和操作方式,顯示方法具備一定跨任務轉移能力;但換個角度看,62% 亦代表它仍然未能在每次嘗試都可靠完成任務。
HOST 的報告亦包括穩健性測試。在改變光線、物件、場景及加入人為干擾後,相對於 62% 的基準成功率,據報成功率分別下降 1%、4%、6% 及 9%。 這些結果說明系統具一定抗變能力,但仍然屬於受控實驗環境下的測試。
GEN-1.5 以大型具身基礎模型的方向呈現同一個概念:先利用大量物理互動經驗建立廣泛能力,之後將一段 3 至 12 秒的人類示範放入模型的上下文記憶,讓模型在不更新權重的情況下,直接嘗試新任務。
Generalist AI 表示,GEN-1.5 可處理影片、語言、感測器及本體感覺等多模態資訊,並能輸出高頻率動作軌跡。公司展示的例子包括開樽、拉開收納袋和將物件掃入碗中;它亦聲稱系統具備人類到機械人的模仿、將兩個提示行為組合起來,以及由模擬影片提示真實機械人執行等能力。
不過,「毋須重新訓練」並不代表所有情況都完全不需要適配。對於較難的任務,Generalist AI 另設少樣本路徑:以 1 至 5 分鐘數據進行 1 至 10 次梯度更新。 因此,最準確的說法是:單次示範模式不需梯度更新;但模型亦支援在必要時作輕量級適配。
兩個系統所展示的,並不是機械人由零開始、完全沒有先驗知識地學習。它們都依賴成本高昂的大規模預訓練:預先建立對物理世界、物件互動及動作控制的基本理解,再把新示範當成一個具體任務的即時指引。
這種做法的真正效率,在於將訓練成本攤分到預訓練階段。對最終使用者來說,教導一個新任務可能由「收集數百段機械人示範、設計獎勵、反覆微調」變成「示範一次,讓模型即時嘗試」。HOST 以平均 29 秒的技能取得時間,以及據報 507 倍的速度提升,將這種取捨量化呈現出來。
這亦代表人機互動界面可能由「編程」轉向「示範」:人類展示目標和步驟,機械人則運用預先學到的物理常識,將示範轉換成適合自己身體和當下環境的動作。
HOST 仍然是受控實驗的學術預印本結果。 它在 50 項選定的新任務上取得 62% 平均成功率,但這不等於已證明能應付開放世界。家居、工業、長流程、安全關鍵情境,以及由獨立團隊重現的結果,仍有待驗證。
GEN-1.5 的證據較難由外部獨立評估。 模型能力、訓練時間、沒有使用模擬數據的說法、提示時長及適配結果,主要由 Generalist AI 發布或由其公告轉述。
兩者目前沒有完全對等的公開基準可直接比較。 GEN-1.5 尚缺乏足夠公開且獨立的資料,去確認標準化任務數量、試驗流程、整體單次示範成功率、基線比較、模型及數據公開程度,或第三方重現結果。因此,GEN-1.5 的示範可視為潛力證據,但未足以確立一個已核實的性能新高點。
總括而言,HOST 提供了較具體的證據,說明機械人可以在一段人類影片後,於推理階段、毋須更新參數,跨越一組明確的操作任務取得新技能;GEN-1.5 則提出另一種可能:當具身模型接受足夠廣泛的物理世界預訓練後,單次示範或許可以成為模型本身的一種上下文學習能力。
方向確實令人鼓舞,但現階段更合理的結論是:機械人的觀察式學習正在成形,尚未足以取代嚴格的任務驗證、安全工程,以及在非受控環境中的適配和測試。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
HOST 與 GEN 1.5 都將人類示範影片當成推理時的「上下文提示」,而不是每次都重新訓練一個新模型。
HOST 與 GEN 1.5 都將人類示範影片當成推理時的「上下文提示」,而不是每次都重新訓練一個新模型。 HOST 在 50 項未見過的操作任務中,平均成功率為 62%,平均約 29 秒便可取得新技能,學習速度據報較每項任務用 50 段機械人示範微調快約 507 倍。[1][3]
GEN 1.5 由 Generalist AI 聲稱可用 3 至 12 秒單次示範即時執行新任務;公司亦報稱在 10 項多元操作任務中,單次示範平均成功率為 59%,但目前缺乏同等規模的獨立驗證。[1][26]