HOST fra Beijing Institute of Technology, X Square Robot og Tsinghua University lærer ifølge forskerne nye manipulationer på gennemsnitligt 29 sekunder uden at opdatere modellens parametre. HOST opnåede en gennemsnitlig succesrate på 62 procent på 50 nye opgaver, men testen foregik i et kontrolleret laboratoriemiljø.
Research answer

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Robotter bliver normalt ikke bedre til en ny opgave ved blot at se et menneske udføre den én gang. Traditionelt kræver det store mængder robotdata, teleoperation, finjustering af modellen og ofte tusindvis af træningstrin.
HOST og GEN-1.5 forsøger at ændre den arbejdsgang. I stedet for at bruge demonstrationen som nye træningsdata behandler systemerne den som kontekst: Robotten ser, hvad der skal gøres, og bruger sin eksisterende fysiske viden til at planlægge handlingen med det samme.
HOST, der står for Human-to-robot One-Shot Skill AcquisiTion, forsøger ikke blot at oversætte menneskets håndbevægelse direkte til robotleddenes bevægelser. Det ville være sårbart, fordi menneskets krop, kameraets vinkel og robottens fysiske udformning er forskellige.
I stedet bruger systemet videoen som en reference for opgavens fremdrift. Robotten vurderer, hvor langt den selv er kommet, finder det tilsvarende trin i demonstrationen og forudsiger, hvordan det ønskede resultat bør se ud fra robottens eget perspektiv. Derefter udleder den de nødvendige handlinger.
Det gør metoden mere fleksibel end simpel bevægelseskopiering. En person kan for eksempel vise, hvordan en genstand flyttes, uden at robotten behøver at efterligne hver enkelt håndbevægelse nøjagtigt.
Forskerne testede HOST på 50 manipulationer, som ikke indgik i den oprindelige træning, med 20 forsøg pr. opgave. Den gennemsnitlige succesrate var 62 procent. Det er et tydeligt tegn på, at én video kan være nok til at aktivere tidligere indlært fysisk viden på tværs af nye genstande, værktøjer og manipulationstyper.
Men 62 procent betyder også, at robotten stadig mislykkes i en betydelig del af forsøgene. Systemet er derfor ikke det samme som en robot, der pålideligt kan udføre enhver ny opgave i et hjem eller på en arbejdsplads.
HOSTs robusthedsforsøg viste desuden rapporterede fald på henholdsvis 1, 4, 6 og 9 procent ved ændringer i belysning, genstande, scene og menneskelig forstyrrelse.
GEN-1.5 fra Generalist AI bygger på en bredere idé: at en stor fysisk grundmodel kan udvikle evnen til at lære nye opgaver direkte fra eksempler i sin kontekst.
En kort video på 3–12 sekunder indsættes som en såkaldt fysisk prompt. Modellen forsøger derefter at udføre opgaven uden at ændre sine parametre. Generalist AI beskriver også evner som menneske-til-robot-efterligning, kombination af flere promptede handlinger, improvisation efter fejl og overførsel fra simulerede demonstrationer til den fysiske verden.
Virksomheden siger, at GEN-1.5 er trænet i mere end otte måneder på omfattende data fra fysisk interaktion og uden simuleringsdata i fortræningen. Den offentlige dokumentation beskriver dog ikke et benchmark med samme detaljeringsgrad som HOSTs 50 opgaver og 20 forsøg pr. opgave.
Generalist AI rapporterer en gennemsnitlig succesrate på 59 procent på 10 forskellige manipulationer ved one-shot-læring. Det er interessant, fordi tallet ligger i samme størrelsesorden som HOSTs 62 procent, men resultaterne kan ikke sammenlignes direkte uden ens opgaver, robotter, forsøgsprotokoller og uafhængig kontrol.
GEN-1.5 er heller ikke altid helt uden yderligere træning. Ved sværere opgaver tilbyder virksomheden en few-shot-tilpasning med 1–10 gradienttrin på få minutters data. One-shot-prompting er altså den træningsfri mulighed, mens modellen også har en mere traditionel tilpasningsvej, når den korte demonstration ikke er tilstrækkelig.
Den store ændring handler ikke om, at robotter pludselig lærer uden tidligere erfaring. Begge systemer bygger på omfattende fortræning. Den dyre læring er blot flyttet frem i processen og fordelt over mange opgaver.
For den enkelte bruger kan resultatet derfor ligne menneskelig læring: Man viser robotten, hvad den skal gøre, i stedet for at programmere hver bevægelse, udforme en belønningsfunktion eller indsamle hundredvis af robotdemonstrationer.
Det er en form for amortisering af træningsomkostningen. En stor model eller politik har allerede lært generelle sammenhænge mellem syn, bevægelse, genstande og fysiske konsekvenser. Den korte video fortæller primært, hvilken ny opgave og fremgangsmåde der er relevant i den aktuelle situation.
HOST gør gevinsten konkret med en gennemsnitlig tilegnelsestid på 29 sekunder og et rapporteret 507-dobbelt hastighedsfortrin i forhold til en metode, der finjusteres med 50 robotdemonstrationer pr. opgave. GEN-1.5 peger i samme retning, men virksomhedens effektivitetskrav mangler en tilsvarende uafhængig måling.
HOST er stadig et kontrolleret forskningsresultat. Evalueringen dækker 50 udvalgte nye opgaver i et laboratoriemiljø. Den dokumenterer ikke endnu, hvordan systemet klarer lange opgaveforløb, rodede hjem, industrielle sikkerhedskrav eller situationer, som forskerne ikke har udvalgt på forhånd.
GEN-1.5 er vanskeligere at efterprøve udefra. Oplysningerne om modellen, træningsperioden, brugen af fysiske data, demonstrationslængden og succesraten kommer primært fra Generalist AI eller virksomhedens egne meddelelser.
Der mangler et fælles benchmark. For GEN-1.5 er der ikke offentliggjort tilstrækkelige uafhængige oplysninger om en standardiseret opgaveliste, forsøgsprotokol, samlet one-shot-succesrate, baseline-sammenligning, modeludgivelse eller tredjepartsreproduktion. Demonstrationerne er derfor tegn på lovende kapacitet – ikke et endeligt bevis på en ny præstationsgrænse.
HOST giver den stærkeste akademiske dokumentation for, at en robot kan tilegne sig nye manipulationer fra én menneskevideo uden opdatering af modellens parametre. GEN-1.5 antyder, at den samme evne kan opstå som en in-context-funktion i en bredt fortrænet fysisk grundmodel.
Retningen er lovende: Robotter kan være på vej fra at blive programmeret opgave for opgave til at blive undervist gennem demonstration. Men teknologien er endnu ikke en erstatning for systematisk validering, sikkerhedsteknik og tilpasning i uforudsigelige miljøer. Den korte video kan sætte en ny færdighed i gang – men den garanterer ikke, at robotten udfører den rigtigt hver gang.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HOST fra Beijing Institute of Technology, X Square Robot og Tsinghua University lærer ifølge forskerne nye manipulationer på gennemsnitligt 29 sekunder uden at opdatere modellens parametre.
HOST fra Beijing Institute of Technology, X Square Robot og Tsinghua University lærer ifølge forskerne nye manipulationer på gennemsnitligt 29 sekunder uden at opdatere modellens parametre. HOST opnåede en gennemsnitlig succesrate på 62 procent på 50 nye opgaver, men testen foregik i et kontrolleret laboratoriemiljø.
Generalist AI hævder, at GEN 1.5 kan lære fra en enkelt demonstration på 3–12 sekunder uden gradientopdateringer eller finjustering.