| Behövs traditionell omträning? | Nej. Nya färdigheter förvärvas i inferenstid utan uppdatering av modellparametrarna. | Inte vid engångsbaserad prompting: företaget uppger att gradientuppdateringar och finjustering inte behövs. |
| Effektivitetsanspråk | Forskarna rapporterar omkring 507 gånger snabbare färdighetsförvärv än övervakad finjustering med 50 robotdemonstrationer per uppgift. | Företaget beskriver en övergång från tiotusentals optimeringssteg till en demonstration på 3–12 sekunder, eller några få anpassningssteg vid svårare uppgifter. Detta är ännu ett företagsanspråk, inte en oberoende benchmarkad jämförelse. |
HOST är det tydligare akademiska beviset på att en robot kan ta till sig en ny fysisk färdighet från en enda mänsklig video utan att modellens parametrar ändras. Demonstrationen används som en aktiv referens under utförandet: roboten följer inte en inspelad bana blint, utan försöker matcha uppgiftens framsteg med sin egen syn och sitt eget kroppstillstånd.
Testerna omfattade 50 uppgifter som inte förekom under träningen, däribland varierande objekt, verktyg och manipulationsmoment. Ett genomsnitt på 62 procent är tillräckligt för att visa att metoden fungerar i en kontrollerad miljö, men också en påminnelse om att roboten fortfarande misslyckas i en betydande andel av försöken.
Forskarna rapporterade dessutom att resultatet stod sig relativt väl när belysning, objekt och scen förändrades eller när en människa störde utförandet. De uppgivna försämringarna var 1, 4, 6 respektive 9 procent.
GEN-1.5 formulerar samma utveckling som en framväxande förmåga hos en bred fysisk grundmodell. I stället för att omvandla demonstrationen till ett nytt träningspaket läggs den i modellens kontext, där den fungerar som en instruktion för det aktuella försöket.
Generalist AI har visat exempel där roboten öppnar en burk, packar eller flyttar föremål och använder redskap. Företaget hävdar också att modellen kan överföra mänskliga demonstrationer till robotar, kombinera flera instruerade beteenden och i vissa fall använda en demonstration från simulering för att utföra uppgiften fysiskt.
Det är samtidigt viktigt att skilja mellan engångsprompting och all form av anpassning. GEN-1.5 kan enligt företaget försöka utföra uppgiften direkt efter en kort demonstration, men har också en alternativ väg där modellen får några gradientsteg på några minuters data. För svårare uppgifter är det alltså inte nödvändigtvis korrekt att beskriva systemet som helt utan träning.
Traditionell robotinlärning kräver ofta uppgiftsspecifik datainsamling, teleoperation, belöningsdesign och finjustering. Den nya modellen liknar i stället hur människor ofta lär sig: visa vad som ska göras, låt den som tittar använda tidigare erfarenhet för att fylla i detaljerna.
För robotar innebär det en mer lättillgänglig undervisningsform. En operatör behöver i bästa fall inte programmera varje rörelse eller samla in hundratals robotdemonstrationer. Den breda förträningen står för den allmänna kunskapen om objekt, kontakt och rörelse, medan videon anger det nya målet och den önskade proceduren.
Effektivitetsvinsten ska därför tolkas med viss precision. Robotarna lär sig inte från noll på några sekunder. Snarare har lång och dyr förträning redan betalats i förväg, så att den nya uppgiften kan specificeras med en kort observation. HOST gör detta utbyte konkret genom de rapporterade 29 sekunderna och den hävdade 507-faldiga hastighetsökningen.
HOST har testats i en kontrollerad laboratoriemiljö. De 50 uppgifterna är ett viktigt experimentellt underlag, men resultatet säger inte automatiskt hur systemet fungerar i hem, fabriker, långa arbetsflöden eller säkerhetskritiska situationer. Den genomsnittliga framgången på 62 procent är dessutom långt från full tillförlitlighet.
GEN-1.5 är svårare att granska utifrån. Uppgifterna om modellens förmågor, träningstid, avsaknad av simuleringsdata, demonstrationslängd och anpassning kommer huvudsakligen från Generalist AI eller från rapportering som återger företagets egna meddelanden.
Resultaten är inte direkt jämförbara. GEN-1.5 saknar ännu ett offentligt, oberoende specificerat testprotokoll med jämförbart antal uppgifter, antal försök, sammanvägd framgångsgrad, baslinjer, modellåtkomst och reproduktion av tredje part.
Sammantaget visar HOST att parameterfri färdighetsinlärning från en enda video kan fungera över en definierad uppsättning nya manipulationsuppgifter. GEN-1.5 pekar samtidigt mot att mycket bred fysisk förträning kan göra liknande beteende till en inbyggd kontextförmåga hos en generalistmodell.
Riktningen är lovande, men slutsatsen bör vara nykter: robotar börjar lära genom observation på ett mer människolikt sätt, men tekniken har ännu inte bevisats ersätta uppgiftstestning, säkerhetsarbete och anpassning i oförutsägbara miljöer.