Skild AI siger, at S1 kan udføre hidtil usete opgaver med flere trin og en varighed på op til 10 minutter efter at have set én menneskevideo – uden finjustering. På virksomhedens egen test nåede den videopromptede model en gennemsnitlig succesrate på 66 procent pr.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI’s S1 er udviklet med en ambition om at gøre robotprogrammering mere intuitiv: I stedet for at programmere eller genlære en robot til hver enkelt opgave viser man den en video af, hvad der skal gøres. Ifølge Skild kan S1 derefter håndtere hidtil usete opgaver med flere trin, der varer op til 10 minutter, uden en ny træningsrunde eller finjustering af modellen. 1
Det er vigtigt, fordi robotter traditionelt har krævet store mængder opgavespecifikke data, fjernstyring, specialudvikling eller genindlæring, før de kunne udføre en ny opgave. S1’s idé er ikke, at robotten afspiller videoen billede for billede. Den skal i stedet forstå målet og sammensætte færdigheder, den allerede har lært, til en ny handlingssekvens.
S1 bruger det, Skild kalder visuel in-context learning – på dansk kan det beskrives som læring ud fra en visuel instruktion i selve udførelsesøjeblikket. Menneskets demonstration fungerer som en opgaveprompt. Modellen observerer handlingerne, udleder formålet og rækkefølgen og omsætter derefter informationen til robotbevægelser i det aktuelle miljø. Ifølge Skild ændres modellens vægte ikke for hver ny demonstration. 1
Det minder derfor mere om at vise en robot, hvad den skal gøre, end om klassisk robottræning. Modellen skal koble synsindtryk med færdigheder, den allerede har lært – eksempelvis at gribe, flytte, placere og manipulere objekter – og sætte dem sammen til en længere procedure. Skild har blandt andet vist eksempler med pour-over-kaffe, plantning af en plante, samling af et sæt og vending af pandekager. 135
Den store udfordring er opgavernes lange tidshorisont. En enkelt bevægelse kan ofte programmeres eller læres isoleret, men en 10 minutter lang opgave kan rumme snesevis af beslutninger, objekter der flytter sig, og mange muligheder for fejl. S1 er beregnet til at fastholde opgavens mål gennem hele forløbet og tilpasse handlingerne til omgivelserne i stedet for blot at gentage demonstratorens præcise bevægelser.
Skild rapporterer en markant forskel mellem videoprompting og sprogprompting i en evaluering af opgaver, modellen ikke havde set under træningen. Ved den oplyste træningsskala på 100.000 timer nåede den videopromptede politik en gennemsnitlig succesrate på 66 procent pr. trin, mens en sammenlignelig sprogpromptet vision-language-action-model nåede 9 procent. 32
Resultatet peger på, at en video kan formidle fysiske detaljer, som ord let efterlader uklare: Hvilket objekt skal gribes? Hvordan skal det vendes? Hvilken rækkefølge skal handlingerne udføres i? Og hvordan reagerer demonstratoren på ændringer i omgivelserne?
Tallene skal dog læses med forbehold. De stammer fra Skilds egen evaluering og er ikke her dokumenteret som et uafhængigt gentaget industristandard-benchmark. Desuden er 66 procent en succesrate pr. trin – ikke en garanti for, at robotten gennemfører en hel 10 minutter lang opgave fra start til slut med samme sandsynlighed.
De offentligt viste eksempler omfatter blandt andet:
Opgaverne er interessante, fordi de kombinerer syn, håndtering af objekter, rækkefølge og vedvarende kontrol i stedet for kun at teste én isoleret bevægelse. Skild beskriver opgaverne som udeladt fra fortræningen, men den tilgængelige dokumentation bygger primært på virksomheden selv og medier, der gengiver dens oplysninger. 133
Videoerne viser den tiltænkte brugerflade: Et menneske udfører opgaven én gang, hvorefter robotten forsøger at generalisere proceduren. De dokumenterer derimod ikke, at S1 pålideligt kan udføre vilkårligt husarbejde, arbejde uden opsyn eller håndtere alle fysiske variationer i en produktionshal.
Den annoncerede fordel ved S1 er, at robotten kan begynde at udføre opgaven efter at have observeret demonstrationen – uden en særskilt træningsfase bagefter. Skild og omtalen af lanceringen beskriver dette som udførelse i realtid gennem in-context learning. 130
De tilgængelige kilder angiver imidlertid ikke en præcis og pålidelig latenstid, for eksempel hvor mange sekunder der går fra videoens afslutning til robotens første handling. At der ikke kræves finjustering betyder, at modellen ikke gennemgår en ny opgavespecifik opdatering af sine vægte. Det betyder ikke nødvendigvis, at enhver video behandles øjeblikkeligt, eller at robotten ikke har brug for opsætning, kalibrering og sikkerhedstjek.
S1 er en del af Skilds større Skild Brain-strategi. Målet er at træne én generel model på tværs af opgaver, robottyper, simulationer og visuelle data fra mennesker i stedet for at udvikle en separat politik til hver robot og hvert job. Skild siger, at virksomheden har skabt et simuleret univers med 100.000 robotvarianter og testet, om modellen kunne generalisere til robotkroppe, der ikke indgik i træningen. 6
Træning på forskellige robotkroppe skal give modellen en forståelse af mere generelle styringsprincipper. Skild beskriver et system, der skal kunne fungere på humanoide robotter, firbenede robotter, bordrobotarme og mobile manipulatorer. 310
Påstanden om, at Skild har 100 til 1.000 gange mere data end konkurrenterne, bør dog behandles forsigtigt. De leverede kilder indeholder ingen standardiseret og uafhængigt kontrollerbar sammenligning af datamængde, datakvalitet eller brugbar robot-erfaring på tværs af virksomheder. Den mere holdbare konklusion er, at Skild forsøger at skalere gennem træning på tværs af robotkroppe og omfattende simulation – ikke kun gennem skræddersyede demonstrationer til én bestemt platform.
“Omni-bodied” er Skilds eget begreb for en model, der skal kunne overføre sin kunnen mellem forskellige robotkroppe. I princippet kan en fælles model lære opgavens overordnede idé uafhængigt af én bestemt maskines geometri og derefter tilpasse sig forskellige lemmer, hjul, gribere og aktuatorer. Skild siger, at modellens simuleringer omfattede robotformer, som blev holdt ude af træningsdataene og styret zero-shot – altså uden forudgående træning på netop disse former. 6
Det gør ikke hardwaren uvæsentlig. Robotter har stadig forskellige sensorer, gribere, ledbegrænsninger, kontrolgrænseflader, latenstider, nyttelaster og sikkerhedskrav. En model, der generaliserer på tværs af robotkroppe, kan muligvis mindske tilpasningsarbejdet, men implementering kræver fortsat kompatibel hardware, systemintegration og grundig validering i det miljø, hvor robotten skal arbejde.
Offentlig omtale siger, at Skilds software kører på hundredvis af robotter i fabrikker, datacentre og logistikmiljøer. Eksemplerne omfatter NVIDIAs fabrik i Houston, et forsøg i LaGuardia samt samarbejde med virksomheder inden for ledningsproduktion og byggeri. Skild har også annonceret relationer med ABB Robotics, Universal Robots og NVIDIA. 174
Oplysningerne peger på kommerciel interesse og afprøvning i den virkelige verden, men der er ikke tilstrækkelig offentlig dokumentation til at beregne produktionsrater, oppetid, besparelser eller investeringsafkast. Resultater fra et laboratorium eller en kontrolleret evaluering bør ikke forveksles med produktionsmål.
En omtale beskriver desuden en planlagt indsats med Foxconn på samlebånd, der forbindes med NVIDIAs Blackwell-GPU-serversystemer. Det dokumenterer et test- eller implementeringsforsøg – ikke, at robotterne allerede driver fabrikker bredt og autonomt. 43
Skilds finansiering har gjort virksomheden til en af de mest fulgte aktører inden for fysisk AI. Bloomberg rapporterede, at Skild i januar 2026 rejste omkring 1,4 milliarder dollar i en Series C-runde ledet af SoftBank. Det satte selskabets værdiansættelse til over 14 milliarder dollar. 13 Skilds tidligere Series A-runde, annonceret i juli 2024, lød på 300 millioner dollar ved en rapporteret værdiansættelse på 1,5 milliarder dollar. 9
Udtrykket “ChatGPT-øjeblik” for robotter beskriver den håbede ændring i brugeroplevelsen: I stedet for at programmere eller genlære en robot til hver opgave kan en medarbejder vise den den ønskede adfærd og lade en generel model omsætte demonstrationen til handlinger.
S1 er et interessant skridt i den retning, men det er endnu ikke et bevis på, at de universelle robotter er landet. De stærkeste offentlige resultater kommer fra virksomheden selv, opgavesættet er fortsat begrænset, og der mangler uafhængigt bekræftede industrimålinger.
Den mest nøgterne konklusion er derfor, at S1 viser en lovende metode til at reducere behovet for opgavespecifik robottræning: Brug en video som instruktion, lad omfattende fortræning levere genanvendelige færdigheder, og test derefter, om robotten kan sætte dem sammen til en ny og langvarig opgave.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI siger, at S1 kan udføre hidtil usete opgaver med flere trin og en varighed på op til 10 minutter efter at have set én menneskevideo – uden finjustering.
Skild AI siger, at S1 kan udføre hidtil usete opgaver med flere trin og en varighed på op til 10 minutter efter at have set én menneskevideo – uden finjustering. På virksomhedens egen test nåede den videopromptede model en gennemsnitlig succesrate på 66 procent pr.
Skilds bredere Skild Brain strategi træner på mange robottyper og simulerede varianter, men der findes endnu ikke offentligt dokumenterede tal for oppetid, produktionsrater eller investeringsafkast.