HOST og GEN 1.5 bruker en kort demonstrasjon som kontekst, slik at roboten kan forsøke en ny oppgave uten å oppdatere modellens parametere. HOST lærte ferdigheter fra én video på gjennomsnittlig 29 sekunder og oppnådde 62 prosent suksess i 50 nye manipulasjonsoppgaver.
Research answer

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Det mest interessante ved HOST og GEN-1.5 er ikke at robotene lærer helt uten forkunnskaper. Begge bygger på omfattende forhåndstrening. Nyvinningen er at denne kunnskapen kan brukes på en ny oppgave etter én kort demonstrasjon – uten en ny, tidkrevende treningsrunde.
Med andre ord går robotlæring fra «samle inn hundrevis av eksempler og finjuster modellen» til «vis roboten hva den skal gjøre, og la den forsøke med en gang».
HOST – forkortelse for «Human-to-robot One-Shot Skill AcquisiTion» – er utviklet av forskere ved Beijing Institute of Technology, X Square Robot og Tsinghua University.
Metoden forsøker ikke bare å kopiere menneskets håndbevegelser direkte. I stedet bruker den videoen som en referanse for hvor langt demonstrasjonen har kommet. Robotens egne kameraer og sensorer brukes deretter til å vurdere robotens situasjon og finne ut hvilke handlinger som kan føre til det demonstrerte resultatet.
Dette er viktig fordi en menneskehånd og en robotarm ikke nødvendigvis har samme form, bevegelsesfrihet eller perspektiv. Direkte bevegelseskopiering kan derfor bli lite robust. HOST prøver i stedet å koble sammen oppgavens fremdrift, det forventede resultatet og robotens egne handlinger.
I testen ble metoden brukt på 50 oppgaver som ikke hadde vært sett under treningen. Oppgavene dekket ulike objekter, verktøy og manipulasjonsformer, med 20 forsøk per oppgave. En gjennomsnittlig suksessrate på 62 prosent viser at tilnærmingen kan generalisere, men også at roboten fortsatt mislykkes i rundt fire av ti forsøk.
Forskerne rapporterte dessuten at ytelsen holdt seg relativt stabil under endringer i lysforhold, objekter, scene og menneskelig forstyrrelse. Tapet fra utgangspunktet på 62 prosent var henholdsvis 1, 4, 6 og 9 prosent.
GEN-1.5 fra Generalist AI presenterer en bredere variant av samme idé. Her legges demonstrasjonen inn i modellens kontekstvindu som en «fysisk prompt». Modellen skal så tolke videoen sammen med språk, sensordata og informasjon om robotens egen kropp – og forsøke oppgaven uten å lage en ny, spesialtrent policy.
Selskapet har vist eksempler som å åpne et glass, åpne en pose med glidelås og feie en kloss ned i en bolle. Det hevdes også at modellen kan overføre demonstrasjoner fra mennesker til roboter, kombinere to instruerte handlinger og bruke en demonstrasjon fra simulering til å utføre oppgaven fysisk.
Det er likevel viktig å skille mellom én-skuddsbruk og modellens alternative tilpasningsmodus. Ved én demonstrasjon skal ingen parametere oppdateres. For vanskeligere oppgaver tilbyr Generalist AI derimot few-shot-tilpasning med gradientsteg på flere minutter med data. GEN-1.5 er derfor ikke «uten trening» i enhver praktisk situasjon.
Tradisjonell robotlæring krever ofte spesialtilpasset datainnsamling, teleoperasjon, belønningsdesign eller omfattende finjustering. Det gjør hver ny oppgave kostbar og tidkrevende.
HOST og GEN-1.5 peker mot et mer menneskelig grensesnitt: Man viser roboten hva som skal gjøres, i stedet for å beskrive hver enkelt bevegelse eller samle inn et stort nytt datasett.
Det betyr ikke at roboten lærer fra ingenting. Den fysiske forståelsen er i stor grad forhåndsbetalt gjennom kostbar trening på store mengder data. Demonstrasjonen forteller modellen hvilken oppgave, fremgangsmåte og interaksjon som er relevant akkurat nå. Kostnaden flyttes altså fra hver enkelt bruker og oppgave til den omfattende forhåndstreningen av grunnmodellen.
HOST gjør denne forskjellen konkret: Forskerne oppgir 29 sekunder for å tilegne seg en ny ferdighet og en hastighetsgevinst på 507 ganger sammenlignet med finjustering basert på 50 robotdemonstrasjoner per oppgave.
HOST er fortsatt en akademisk preprint. Resultatene kommer fra et kontrollert laboratorieoppsett med 50 utvalgte oppgaver og 62 prosent gjennomsnittlig suksessrate. Det er ikke dokumentert at metoden fungerer like godt i åpne hjemmemiljøer, lange oppgavesekvenser, industriscenarioer eller sikkerhetskritiske situasjoner. Uavhengige replikasjoner mangler også.
GEN-1.5 er vanskeligere å etterprøve utenfra. Opplysningene om modellen, treningsperioden, fraværet av simuleringsdata, demonstrasjonslengden og tilpasningsmetoden kommer i hovedsak fra Generalist AI eller omtale av selskapets egne kunngjøringer.
Det finnes ingen tilsvarende offentlig benchmark for GEN-1.5. Det mangler uavhengig dokumentasjon av et standardisert oppgavesett, forsøksprotokoll, samlet suksessrate for én demonstrasjon, sammenlignbare baseliner, modell- og datalansering eller tredjepartsreproduksjon. Demonstrasjonene viser derfor et lovende potensial, men er ikke i seg selv bevis på en verifisert ytelsesfront.
Samlet gir HOST et mer konkret forskningsbelegg for at roboter kan tilegne seg nye manipulasjonsferdigheter fra én video uten parameteroppdatering. GEN-1.5 antyder samtidig at bred nok forhåndstrening kan gjøre tilsvarende ferdigheter til en generell egenskap i en fysisk grunnmodell.
Retningen er lovende, men konklusjonen bør være nøktern: Roboter begynner å lære mer slik mennesker lærer – ved å observere. Det er likevel langt igjen før korte demonstrasjoner kan erstatte grundig validering, sikkerhetsteknikk og tilpasning i uforutsigbare omgivelser.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HOST og GEN 1.5 bruker en kort demonstrasjon som kontekst, slik at roboten kan forsøke en ny oppgave uten å oppdatere modellens parametere.
HOST og GEN 1.5 bruker en kort demonstrasjon som kontekst, slik at roboten kan forsøke en ny oppgave uten å oppdatere modellens parametere. HOST lærte ferdigheter fra én video på gjennomsnittlig 29 sekunder og oppnådde 62 prosent suksess i 50 nye manipulasjonsoppgaver.
GEN 1.5 hevdes å kunne bruke 3–12 sekunders demonstrasjon, men resultatene er i hovedsak publisert av Generalist AI og er foreløpig svakt uavhengig verifisert.