Skild AI siger, at S1 kan se én video af en ukendt opgave på op til 10 minutter og udføre den uden at ændre modellens vægte eller indsamle opgavespecifikke data. Demonstrationerne omfatter blandt andet pour over kaffe, potning af planter, samling af et sæt og pandekagevending.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI’s S1 er en såkaldt robot-fundamentmodel, der bygger på in-context learning – altså læring ud fra den aktuelle sammenhæng i stedet for ny træning for hver enkelt opgave. Robotten ser en video af en person, der udfører en opgave, og bruger demonstrationen som en praktisk instruktion. Skild AI siger, at S1 kan håndtere hidtil usete opgaver, der varer op til 10 minutter, uden opgavespecifik finjustering eller ændringer af modellens vægte. 1
5
Det er et interessant skridt mod mere fleksibel fysisk kunstig intelligens. Det er dog ikke det samme som et bevis på, at alsidige robotter nu er klar til frit at arbejde i private hjem eller på fabrikker. De stærkeste resultater stammer foreløbig fra Skild AI’s egne demonstrationer og benchmarks, så uafhængige tests er fortsat afgørende.
Mange systemer til robotlæring trænes til en bestemt opgave, robotkrop eller driftsbetingelse. S1 behandler i stedet en demonstrationsvideo som en slags udførbar prompt. Modellen skal udlede målet, rækkefølgen af handlinger, forholdet mellem objekterne og de fysiske justeringer, der skal til for at gentage opgaven på en robot. 1
3
Det er noget andet end blot at bede en robot om at “lave kaffe” eller “flytte planten”. Sprog kan beskrive et mål, men en video kan også vise rækkefølgen, grebet om et objekt, brugen af værktøj og hele forløbet over mange trin. Skild AI’s centrale påstand er, at denne rigere instruktion gør S1 i stand til at generalisere til lange opgaver, som ikke indgik i fortræningen. 1
5
Virksomheden beskriver tilgangen som robotteknologiens svar på at prompte en sprogmodel: Modellens grundlæggende evner forbliver de samme, mens demonstrationen leverer den opgavespecifikke kontekst.
Skild AI har vist S1 udføre flere praktiske manipulationsopgaver, blandt andet:
Nogle demonstrationer varer op til 10 minutter og består af dusinvis af handlinger i rækkefølge. 1
3
5
Skild AI har også beskrevet kvalitative tests, der skulle vise, at S1 ikke blot afspiller en indlært bevægelse. I testene skulle modellen have reageret på ændringer i omgivelserne, forsøgt igen efter visse fejl, brugt en kop, da den viste vandkande ikke var tilgængelig, og korrigeret en klodset måde at håndtere et æg på i stedet for at kopiere den præcist. Det peger på en vis adfærdsmæssig fleksibilitet, men videodemonstrationer alene dokumenterer ikke stabil drift i mange forskellige miljøer. 5
Den mest konkrete sammenligning fra Skild AI kommer fra en intern evaluering af ukendte opgaver. Ved 100.000 timers træningsdata rapporterede virksomheden en gennemsnitlig succesrate på 66 procent pr. trin for sin videopromptede in-context-politik mod 9 procent for en sammenlignelig sprogstyret VLA-baseline. VLA står for vision-language-action – modeller, der kombinerer syn, sprog og robotstyring. 1
4
Skild AI siger også, at den sprogstyrede VLA-model blev forringet op til tre gange mere end S1, når forholdene under udførelsen ændrede sig markant. Det kunne for eksempel være, når objekterne var anderledes end i demonstrationen, eller når planen krævede brug af den modsatte arm. 1
En anden sammenligning fra virksomheden anslog, at én videoprompt gav en ydeevne, der svarede omtrent til 380 opgavespecifikke eftertrænings-episoder på en fortrænet politik. 1
Tallene illustrerer, hvorfor videoprompting kan være interessant: En demonstration kommunikerer ikke kun det ønskede resultat, men også rækkefølge, timing, placering af objekter, værktøjsbrug og fysisk strategi. Resultaterne bør dog læses som Skild AI’s interne dokumentation, ikke som et uafhængigt gentaget head-to-head-benchmark. Det fremlagte materiale indeholder hverken en offentlig forskningsartikel, modelvægte eller en standardiseret ekstern evaluering. 4
15
Skild AI beskriver S1 som et system, der arbejder i realtid efter at have set demonstrationen. Omtale omkring lanceringen hævdede, at robotten kunne udføre opgaven umiddelbart efter visningen. 2
5
Der er dog ikke tilstrækkeligt belæg for et verificeret tal som “på få sekunder” eller “inden for 11 minutter” for systemet generelt. De fremlagte kilder fastslår ikke en præcis overgangstid fra videoens afslutning til udførelsens begyndelse. Den forskel er vigtig i industrien, hvor opsætningstid, latenstid, sikkerhedstjek og evnen til at håndtere fejl kan være lige så afgørende som modellens rå succesrate.
Skild AI tilskriver en bred datapipeline en vigtig rolle i udviklingen af en mere generel robotmodel. Virksomheden har beskrevet brug af storskala-simulationer, internetvideoer af menneskelige handlinger, robotdata, fjernstyring og information fra robotter i den virkelige verden. I materialet om Series C beskriver virksomheden også en datafeedbacksløjfe, hvor udrulning skaber nye erfaringer, som kan forbedre modellen på tværs af robotter og miljøer. 37
Ved SMARTCLOUD SHOW skal medstifter Abhinav Gupta have sagt, at Skild AI bruger “alle former” for robotdataindsamling og har opbygget 100 til 1.000 gange mere data end konkurrenterne. Denne faktor er en påstand fra virksomheden, ikke en offentligt revideret sammenligning af branchen. 6
I praksis kombinerer strategien datakilder, der lærer modellen forskellige dele af problemet: Menneskevideoer viser objekter og handlinger, simulationer udvider udvalget af robotkroppe og miljøer, mens data fra virkelige robotter forbinder disse abstraktioner med fysisk styring.
S1 indgår i Skild AI’s bredere strategi for en “omni-bodied” robotjerne. Udtrykket betyder ikke, at en robot med ben, en firbenet robot, en robot på hjul og en robotarm bevæger sig på samme måde. Deres led, sensorer, lemmer, hjul og fysisk mulige handlinger er forskellige. 45
Tanken er i stedet, at arkitekturen lærer fysiske sammenhænge, der kan overføres mellem platforme, og derefter omsætter dem til handlinger, som den konkrete robot faktisk kan udføre. Én model kan dermed dele viden på tværs af forskellige robottyper, mens dens output tilpasses de aktuatorer og sensorer, robotten har adgang til. 45
Målet er at mindske behovet for at udvikle og vedligeholde en helt separat model til hver robotkonfiguration. Skild AI har desuden beskrevet træning på et stort antal simulerede robotkroppe som en del af arbejdet med at lære mere generel fysisk adfærd. 42
45
Skild AI har offentliggjort samarbejder med ABB Robotics og Universal Robots om at integrere softwaren i industrielle systemer. Reuters har desuden rapporteret, at Skild AI og Nvidia udruller robotmodellen på samlebånd forbundet med Nvidias Blackwell-systemer. 34
44
Annonceringerne viser en vej mod kommerciel afprøvning, men de udgør ikke en fuldstændig offentlig resultatopgørelse. Det fremlagte materiale dokumenterer ikke uafhængigt reviderede tal for fabrikkernes kapacitet, oppetid, fejlrate, sikkerhedshændelser eller afkast på investeringen. At en teknologi bliver integreret eller afprøvet, er derfor ikke det samme som, at den allerede har erstattet traditionel automatisering i stor skala.
Investorernes interesse for Skild AI har været markant. Bloomberg rapporterede om en Series C-runde på 1,4 milliarder dollar, ledet af SoftBank, som værdisatte virksomheden til mere end 14 milliarder dollar – over tre gange værdisætningen cirka syv måneder tidligere. 17
Andre rapporter placerer Skild AI’s samlede finansiering over 1,8 milliarder dollar, men de tilgængelige opgørelser varierer fra kilde til kilde og bør ikke opfattes som et endeligt, revideret totalbeløb. 18
21
22
Sammenligningen med et “ChatGPT-øjeblik for robotter” bør derfor forstås som en analogi, ikke som en fastslået konklusion. S1 peger på en mulig ændring i den måde, robotter tilegner sig nye færdigheder på: fra opgave-for-opgave-genoptræning til læring ud fra demonstrationer. Investor Ravi Mhatre kaldte lanceringen et “GPT-3-øjeblik” for lange opgaver fra menneskeligt arbejde, men det er en investorm vurdering – ikke en uafhængig videnskabelig validering. 10
S1’s vigtigste idé er ikke bare, at en robot kan efterligne en video. Det afgørende er, at en fundamentmodel måske kan bruge én demonstration til at sammensætte færdigheder, tilpasse sig ændrede omgivelser og udføre en lang sekvens uden at få opdateret sine vægte til netop den opgave.
Skild AI’s rapporterede resultat på 66 procent mod 9 procent og demonstrationerne af lange opgaver gør påstanden teknisk interessant. 1
4 Forbeholdet er lige så vigtigt: Den offentlige dokumentation består fortsat hovedsageligt af virksomhedsmateriale, udvalgte demonstrationer og tidlige meldinger om udrulning. Før eksterne forskere kan gentage resultaterne under standardiserede forhold, og industrikunder offentliggør data om driftssikkerhed og sikkerhed, bør S1 ses som en lovende retning for fysisk AI – ikke som det endelige bevis på, at den universelle robotjerne er ankommet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI siger, at S1 kan se én video af en ukendt opgave på op til 10 minutter og udføre den uden at ændre modellens vægte eller indsamle opgavespecifikke data.
Skild AI siger, at S1 kan se én video af en ukendt opgave på op til 10 minutter og udføre den uden at ændre modellens vægte eller indsamle opgavespecifikke data. Demonstrationerne omfatter blandt andet pour over kaffe, potning af planter, samling af et sæt og pandekagevending.
Teknologien er på vej ind i industrielle robotsystemer, men de offentligt tilgængelige oplysninger dokumenterer endnu ikke produktionsmål som oppetid, kapacitet, fejlrate eller afkast på investeringen.