HOST, développé par le Beijing Institute of Technology, X Square Robot et l’université Tsinghua, acquiert une compétence à partir d’une vidéo humaine de 29 secondes en moyenne, sans mise à jour des paramètres. Le système a obtenu un taux de réussite moyen de 62 % sur 50 tâches inédites, avec 20 essais par tâche.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Deux projets récents proposent de changer la manière d’enseigner une nouvelle manipulation à un robot. Au lieu de collecter des centaines de démonstrations, de modifier les paramètres d’un modèle ou de relancer un long entraînement, ils utilisent une courte vidéo comme contexte : le robot l’observe, interprète l’objectif, puis tente la tâche immédiatement.
HOST fournit aujourd’hui l’élément de preuve académique le plus structuré. GEN-1.5, de Generalist AI, décrit une approche proche à l’échelle d’un modèle généraliste, mais ses résultats sont moins faciles à vérifier indépendamment.
HOST ne cherche pas simplement à reconstruire la trajectoire exacte de la main dans la vidéo. Cette stratégie serait fragile : le robot n’a ni le même corps, ni les mêmes articulations, ni nécessairement le même point de vue que la personne filmée.
Le système utilise plutôt la vidéo comme un repère de progression. Il estime où en est la tâche — par exemple, saisir un objet, le déplacer ou le déposer — puis met cette étape en relation avec ses propres observations et l’état de son corps. Il prédit ensuite le résultat attendu depuis le point de vue du robot et déduit les actions nécessaires pour y parvenir.
Cette acquisition a lieu au moment de l’exécution, sans mise à jour des poids du modèle. Le robot peut donc ajouter une nouvelle compétence sans écraser, en principe, celles qu’il possédait déjà : un avantage important par rapport aux méthodes de réglage fin, qui peuvent provoquer un « oubli catastrophique » des tâches antérieures.
Sur 50 tâches inédites, évaluées 20 fois chacune, HOST atteint 62 % de réussite moyenne. Le résultat montre une généralisation à de nouveaux objets, outils et gestes, mais il signifie aussi qu’une tentative échoue encore dans une proportion importante des cas.
Les tests de robustesse rapportés par les chercheurs indiquent une baisse de 1 % avec une variation de l’éclairage, de 4 % avec un changement d’objet, de 6 % avec un changement de scène et de 9 % en présence de perturbations humaines.
GEN-1.5 poursuit une logique similaire, mais l’inscrit dans un modèle généraliste de l’IA incarnée. Une courte séquence vidéo est placée dans la fenêtre de contexte du modèle, au même titre qu’une consigne peut l’être pour un modèle de langage. Elle ne sert pas à réentraîner une nouvelle politique : elle indique au modèle le comportement à produire ici et maintenant.
Generalist AI affirme que GEN-1.5 peut apprendre une tâche à partir d’une seule démonstration de 3 à 12 secondes, généraliser cette consigne à de nouvelles situations, récupérer après certaines erreurs et improviser une stratégie pour atteindre le même objectif. L’entreprise évoque également l’imitation d’un humain par un robot, l’enchaînement de deux comportements et le transfert d’une démonstration simulée vers une exécution physique.
Le modèle propose toutefois une deuxième voie, qui nuance l’expression « sans entraînement ». Si la démonstration unique ne suffit pas, GEN-1.5 peut être adapté en quelques étapes de gradient à partir de quelques minutes de données. Le mode one-shot est donc sans mise à jour des paramètres ; les tâches plus difficiles peuvent toujours nécessiter une adaptation ciblée.
L’intérêt de ces travaux dépasse la seule réduction du temps d’entraînement. Ils dessinent une interface plus proche de l’apprentissage humain : montrer un geste plutôt que programmer chaque mouvement, concevoir une fonction de récompense ou organiser une vaste collecte de données robotiques.
Cela ne signifie pas que le robot apprend à partir de rien. Les connaissances physiques générales ont été acquises lors d’un préentraînement coûteux et à grande échelle. La vidéo courte sert ensuite à spécifier la nouvelle tâche, sa procédure et les interactions pertinentes. Le coût de cette formation initiale est ainsi « amorti » sur de nombreuses tâches : l’utilisateur final n’a plus besoin de recommencer une optimisation complète pour chaque geste.
HOST quantifie clairement ce compromis avec ses 29 secondes d’acquisition et son gain annoncé de 507 fois sur la méthode de comparaison. GEN-1.5 suggère, de son côté, qu’un modèle ayant accumulé suffisamment d’expérience physique peut faire émerger l’apprentissage en contexte comme une capacité générale.
HOST n’est pas encore une preuve de fiabilité en environnement ouvert. Il s’agit d’un préprint évalué sur 50 tâches sélectionnées en laboratoire, avec 62 % de réussite moyenne. Les performances sur des tâches domestiques, industrielles, longues ou critiques pour la sécurité restent à établir, notamment par des réplications indépendantes.
Les deux chiffres ne sont pas directement comparables. HOST publie un nombre de tâches, un nombre d’essais et une moyenne détaillée. Pour GEN-1.5, les résultats publics reposent surtout sur des démonstrations de Generalist AI et sur les communications de l’entreprise, sans protocole standardisé suffisamment documenté.
Le taux de réussite de GEN-1.5 reste difficile à vérifier. Il n’existe pas, dans les éléments publics disponibles, de benchmark indépendant consolidé précisant le nombre total d’essais, les conditions expérimentales, les baselines, les données du modèle ou une reproduction par un tiers.
Les tâches présentées sont courtes et ciblées. Réussir à ouvrir un bocal ou à déplacer un objet ne garantit pas encore la maîtrise d’une activité longue, ambiguë, dangereuse ou remplie d’imprévus.
Au total, HOST apporte une démonstration concrète de l’acquisition d’une compétence par vidéo unique, sans mise à jour des paramètres, sur un ensemble défini de manipulations. GEN-1.5 indique qu’un modèle généraliste suffisamment préentraîné pourrait transformer la même idée en capacité d’apprentissage en contexte à grande échelle.
La tendance est donc crédible et importante, mais elle ne remplace pas encore la validation tâche par tâche, l’ingénierie de sécurité ni l’adaptation nécessaire aux environnements réels et non contraints.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
HOST, développé par le Beijing Institute of Technology, X Square Robot et l’université Tsinghua, acquiert une compétence à partir d’une vidéo humaine de 29 secondes en moyenne, sans mise à jour des paramètres.
HOST, développé par le Beijing Institute of Technology, X Square Robot et l’université Tsinghua, acquiert une compétence à partir d’une vidéo humaine de 29 secondes en moyenne, sans mise à jour des paramètres. Le système a obtenu un taux de réussite moyen de 62 % sur 50 tâches inédites, avec 20 essais par tâche.
GEN 1.5 de Generalist AI traite une démonstration de 3 à 12 secondes comme une « invite physique » et produit immédiatement des actions robotiques, sans gradient ni réglage fin annoncés.