HOST和GEN 1.5的共同思路,是让预训练模型在推理阶段把人类演示视频当作上下文,而不是为每个新任务重新更新模型参数。 HOST平均约用29秒获取技能,在50项未见过的操作任务上取得62%的平均成功率;研究团队称其技能获取速度约比每项任务使用50条机器人演示进行监督微调快507倍。[1][3] GEN 1.5由Generalist AI开发,宣称可通过3至12秒的一次演示直接尝试新任务;遇到更困难的任务时,也可用1至10次梯度更新进行少样本适配。[26]
研究答案

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
机器人学习正在从“为每项任务重新训练”转向“看示范后即时执行”。HOST和GEN-1.5代表了这一转变:机器人并非从零开始学习,而是先依靠大规模预训练获得通用的物理操作能力,再把一段简短的人类视频作为当前任务的上下文提示,直接生成动作。
这意味着,用户不必为每个新任务采集数百条机器人演示、重新微调模型,甚至不必逐步编写动作程序。更准确地说,昂贵的通用训练被提前完成;当新任务出现时,演示视频只负责告诉机器人“要做什么、操作顺序大致如何,以及任务进展到哪一步”。
HOST的关键并不是简单地把人类手臂的轨迹复制给机器人。由于人的身体结构、视角和机器人机械臂都可能不同,直接复现坐标往往难以稳定工作。
HOST采用的是一种与任务进度相关的模仿方式:系统先判断机器人目前处于任务的哪个阶段,再在演示视频中寻找相应的进度位置;随后,它从机器人自身的视角预测完成目标后可能出现的结果,并据此反推出需要执行的动作。
这种设计让视频成为“正在执行什么任务”的动态参照,而不是一条必须逐帧重放的动作轨迹。由于模型参数在推理阶段保持不变,机器人获得新技能时也不会因为微调而覆盖此前掌握的能力。
在实验中,HOST覆盖了50项新的桌面操作任务,每项任务进行20次试验,平均成功率为62%。这说明单段人类视频确实可以帮助机器人跨越新的物体、工具和操作方式,但也说明它距离“任何任务都能可靠完成”仍有明显距离。
研究团队还报告了多种干扰测试结果:在改变光照、物体、场景和加入人类干扰后,系统相对原始表现的成功率损失分别约为1%、4%、6%和9%。
GEN-1.5采取了更偏向通用基础模型的路线。Generalist AI将一段传感器运动演示称为“物理提示”:模型把这段视频放入上下文窗口,结合自身的视觉、语言、传感器和本体感知信息,随后直接尝试执行任务。
公司公开展示的任务包括打开罐子、拉开袋子拉链、把物体扫进碗里、将马克笔放进杯子,以及倾倒螺栓等。相关公告还宣称,模型具备一定的人类动作到机器人动作迁移、行为组合、工具临时使用,以及从仿真演示提示现实执行的能力。
不过,“一次提示”并不意味着GEN-1.5在所有任务中都完全不需要训练。对于一次演示难以解决的任务,公司还提供少样本适配路径:使用1至5分钟数据,执行1至10次梯度更新,约对应10至50次演示。因此,更准确的表述是:简单或已被基础模型覆盖的任务可以一次性提示;更困难的任务仍可能需要极少量适配。
两项研究共同支持了一个重要方向:机器人学习新动作的交互方式,可以更接近人类教学——“做给它看”,而不是“为它编程”。
传统机器人学习通常需要为每个任务收集大量机器人数据,再进行任务专属训练。这样的流程成本高、周期长,而且反复微调可能导致模型遗忘旧技能。HOST和GEN-1.5则把大规模训练的作用前置,让预训练模型掌握广泛的物理先验;在部署时,只需用一段演示指定新的目标和操作过程。
但这里的“免训练”需要准确理解:机器人并不是没有经过训练,也不是仅凭一段视频就从零学会物理规律。真正被省略的是面向当前任务的传统重训练。HOST报告的平均29秒获取时间和约507倍速度提升,正是这种“把通用训练成本摊薄,再用短演示完成任务指定”的体现。
HOST的结果来自受控实验。 论文在50项选定的新操作任务上报告了62%的平均成功率,但这并不等同于机器人已经能在开放家庭环境、复杂工业流程、长时任务或安全关键场景中稳定工作。
HOST仍需要更广泛的复现。 其结果有较清晰的实验任务和试验次数,但独立团队在不同机器人、不同环境和不同任务分布上的验证,仍是判断实际泛化能力的重要一步。
GEN-1.5的公开证据较难独立评估。 关于模型能力、训练时长、预训练不使用仿真数据、演示时长和适配方式的信息,主要来自Generalist AI及其公告,或由相关报道转述。
GEN-1.5尚缺少可直接对比的公开基准。 目前没有足够的独立公开证据,能够确认其标准化任务数量、统一试验协议、综合一次性成功率、基线对比、模型与数据发布情况,或第三方复现结果。因此,现有演示更适合被视为能力潜力的证据,而不是已经确立的性能上限。
综合来看,HOST提供了较具体的学术证据,表明机器人可以在推理阶段通过单段人类视频、无需更新参数,获取一项定义明确的新操作技能;GEN-1.5则表明,规模足够大的具身预训练模型,可能把类似能力发展为通用模型的上下文学习能力。
方向本身令人关注,但结论仍应保持克制:机器人“看一遍就会”正在出现,却还不能替代开放环境中的任务验证、安全工程和必要的适配训练。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
HOST和GEN 1.5的共同思路,是让预训练模型在推理阶段把人类演示视频当作上下文,而不是为每个新任务重新更新模型参数。
HOST和GEN 1.5的共同思路,是让预训练模型在推理阶段把人类演示视频当作上下文,而不是为每个新任务重新更新模型参数。 HOST平均约用29秒获取技能,在50项未见过的操作任务上取得62%的平均成功率;研究团队称其技能获取速度约比每项任务使用50条机器人演示进行监督微调快507倍。[1][3]
GEN 1.5由Generalist AI开发,宣称可通过3至12秒的一次演示直接尝试新任务;遇到更困难的任务时,也可用1至10次梯度更新进行少样本适配。[26]