Skild AI sier at S1 kan utføre tidligere ukjente oppgaver på opptil ti minutter etter å ha sett én menneskelig video, uten finjustering. Videoen fungerer som en instruksjon i selve kjøretiden: S1 kombinerer ferdigheter den har lært under forhåndstreningen, og setter dem sammen til handlinger i robotens aktuelle miljø.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI vil gjøre robotprogrammering mer lik det å lære bort en oppgave til et menneske: Du viser roboten hva den skal gjøre, i stedet for å programmere eller trene den på nytt fra grunnen av.
Selskapets nye modell, S1, skal kunne se én video av en person som utfører en oppgave og deretter prøve å gjennomføre en tidligere ukjent, flertrinnsoppgave i opptil ti minutter. Ifølge Skild skjer dette uten en ny, oppgavespesifikk treningsrunde eller finjustering av modellens vekter. 1
Det betyr ikke at roboten husker videoen bilde for bilde. Tanken er at S1 tolker målet, gjenkjenner relevante objekter og setter sammen ferdigheter den allerede har lært – som å gripe, flytte, helle, plassere og manipulere – til en ny handlingssekvens.
S1 bygger på det Skild kaller visuell læring i kontekst. Menneskets demonstrasjon fungerer som en instruksjon når modellen skal utføre oppgaven. Den observerer hva som skjer, forsøker å forstå både rekkefølgen og målet, og oversetter dette til robotens bevegelser i det aktuelle miljøet. Ifølge Skild endres ikke modellens vekter for hver nye demonstrasjon. 1
Dette skiller seg fra tradisjonell robotopplæring, der en ny oppgave ofte krever store mengder data, fjernstyring, spesialtilpasset ingeniørarbeid eller en ny treningsrunde. S1 skal i stedet kunne bruke generelle ferdigheter fra forhåndstreningen og kombinere dem på nytt.
Skild har vist eksempler som:
Den krevende delen er oppgavenes lange tidshorisont. En ti minutter lang oppgave kan bestå av dusinvis av delbeslutninger, objekter som flytter på seg og situasjoner der roboten må korrigere kursen. Målet er derfor ikke bare å gjenta demonstratørens eksakte bevegelser, men å holde fast ved oppgaven og tilpasse handlingene til omgivelsene.
Skild rapporterer en tydelig forskjell mellom video- og språkbaserte instrukser i en test av oppgaver modellen ikke hadde sett tidligere. Ved en oppgitt treningsskala på 100 000 timer oppnådde den videobaserte modellen 66 prosent gjennomsnittlig suksess per steg, mens en sammenlignbar språkstyrt vision-language-action-modell oppnådde 9 prosent. 32
En video kan formidle fysiske detaljer som ord ofte gjør uklare: hvilket objekt roboten skal gripe, hvordan det skal holdes, hvilken rekkefølge handlingene kommer i, og hvordan demonstratøren reagerer på situasjonen.
Tallene må likevel leses med forsiktighet. Dette er Skilds egen evaluering, ikke en uavhengig gjentatt industristandard. Dessuten er «66 prosent suksess per steg» ikke det samme som at roboten har 66 prosent sjanse for å fullføre en hel ti minutter lang oppgave. Når mange steg følger etter hverandre, kan samlet gjennomføringssannsynlighet bli betydelig lavere.
De offentlig viste eksemplene kombinerer syn, håndtering av objekter, riktig rekkefølge og langvarig kontroll. Det gjør dem mer krevende enn en enkeltstående bevegelse som å gripe en gjenstand.
Skild beskriver oppgavene som nye for modellen under forhåndstreningen. Den tilgjengelige dokumentasjonen kommer imidlertid i hovedsak fra selskapet selv og omtaler av selskapets resultater. 133
Demonstrasjonene viser den tiltenkte brukeropplevelsen: En person utfører oppgaven én gang, og roboten forsøker å generalisere fremgangsmåten. De beviser ikke at S1 kan utføre vilkårlig husarbeid, arbeide uten tilsyn eller håndtere alle variasjoner i et industrielt miljø.
En viktig del av løftet er at roboten skal kunne begynne etter å ha observert demonstrasjonen, uten en separat treningsfase i etterkant. Skild og omtaler av lanseringen beskriver dette som kjøring i sanntid. 130
Det finnes likevel ingen pålitelig, presis offentlig måling av forsinkelsen – for eksempel hvor mange sekunder det går fra videoen er ferdig til roboten gjør sin første bevegelse. «Ingen finjustering» betyr at modellen ikke gjennomgår en ny oppgavespesifikk oppdatering av vektene. Det betyr ikke nødvendigvis at videoen behandles øyeblikkelig, eller at roboten ikke trenger klargjøring, kalibrering og sikkerhetskontroller.
S1 er del av Skilds bredere strategi rundt Skild Brain. Selskapet forsøker å bygge én generell modell som kan trenes på tvers av oppgaver, robotkropper, simuleringer og visuelle data fra mennesker, i stedet for å lage en separat modell for hver robot og jobb.
Skild sier at de har laget en simulert verden med 100 000 robotvarianter, og at modellen er testet på robotformer som var holdt utenfor treningsmaterialet. 6
Trening på mange ulike «kropper» skal gi modellen mer generelle prinsipper for styring. Skild beskriver et system som skal kunne fungere på blant annet humanoide roboter, firbeinte roboter, bordarmer og mobile manipulatorer. 310
Påstander om at Skild har 100 til 1 000 ganger mer data enn konkurrentene, bør derimot behandles varsomt. Kildene som er tilgjengelige her, gir ingen standardisert og uavhengig sammenligning av datamengde, datakvalitet eller nyttig roboterfaring mellom selskapene. Det sikreste man kan si, er at Skild satser på skala gjennom simulering og trening på tvers av robottyper – ikke bare på skreddersydde demonstrasjoner for én bestemt maskin.
«Omni-bodied» er Skilds uttrykk for en modell som skal kunne overføres mellom ulike robotkropper. I teorien kan en felles modell lære oppgaveforståelse på et mer overordnet nivå, uten å være bundet til geometrien og aktuatorene i én bestemt maskin. Skild sier at simuleringstestene omfattet robotformer modellen ikke hadde sett under treningen, og at disse ble styrt uten spesifikk forhåndstilpasning. 6
Det gjør ikke maskinvaren uviktig. Roboter har ulike sensorer, gripeverktøy, leddgrenser, nyttelaster, forsinkelser, kontrollgrensesnitt og sikkerhetskrav. En modell som generaliserer mellom robotkropper, kan redusere tilpasningsarbeidet, men utrulling krever fortsatt kompatibel maskinvare, systemintegrasjon og testing i det konkrete miljøet.
Offentlig omtale sier at Skilds programvare kjører på hundrevis av roboter i fabrikker, datasentre og logistikkmiljøer. Eksemplene som er nevnt, omfatter NVIDIAs fabrikk i Houston, et forsøk ved LaGuardia og arbeid med selskaper innen kabling og bygg. Skild har også kunngjort samarbeid knyttet til ABB Robotics, Universal Robots og NVIDIA. 174
Dette tyder på kommersiell interesse og testing i virkelige miljøer. Det finnes likevel ikke nok offentlig dokumentasjon til å beregne uavhengig bekreftede tall for produksjonsgrad, oppetid, kostnadsbesparelser eller avkastning på investeringene.
Et resultat fra et laboratorium eller en kontrollert test bør derfor ikke omtales som et produksjonsresultat. En rapport beskriver også en planlagt utrulling sammen med Foxconn på monteringslinjer for NVIDIAs Blackwell GPU-serversystemer. Det er dokumentasjon på et test- eller utrullingsprosjekt, ikke et bevis på at autonome roboter allerede driver fabrikker i stor skala. 43
Skilds finansiering har gjort selskapet til en av de mest fulgte aktørene innen fysisk kunstig intelligens. Bloomberg rapporterte at selskapet hentet rundt 1,4 milliarder dollar i en SoftBank-ledet serie C-runde i januar 2026, til en verdsettelse på over 14 milliarder dollar. 13 Den tidligere serie A-runden, kunngjort i juli 2024, var på 300 millioner dollar, til en rapportert verdsettelse på 1,5 milliarder dollar. 9
Uttrykket «ChatGPT-øyeblikket» beskriver den håpede endringen i hvordan mennesker bruker roboter: I stedet for å programmere eller trene en maskin på nytt for hver oppgave, kan en arbeidstaker vise hva som skal gjøres og la en generell modell oversette demonstrasjonen til handlinger.
S1 er et tydelig steg i den retningen. Men modellen er ikke i seg selv et bevis på at allsidige roboter nå er klare for hjemmet eller fabrikken. De sterkeste offentlige resultatene er rapportert av selskapet selv, oppgavesettet er fortsatt begrenset, og uavhengig verifiserte nøkkeltall fra industrien er ikke tilgjengelige i kildematerialet.
Den mest nøkterne konklusjonen er derfor at S1 viser en lovende metode for å redusere behovet for oppgavespesifikk robottrening: Bruk en video som instruksjon, hent frem gjenbrukbare ferdigheter fra bred forhåndstrening, og test om roboten kan sette dem sammen til en ny oppgave med lang tidshorisont.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI sier at S1 kan utføre tidligere ukjente oppgaver på opptil ti minutter etter å ha sett én menneskelig video, uten finjustering.
Skild AI sier at S1 kan utføre tidligere ukjente oppgaver på opptil ti minutter etter å ha sett én menneskelig video, uten finjustering. Videoen fungerer som en instruksjon i selve kjøretiden: S1 kombinerer ferdigheter den har lært under forhåndstreningen, og setter dem sammen til handlinger i robotens aktuelle miljø.
Skilds bredere strategi er å trene én modell på mange robottyper og simulerte varianter.