Skild AI uppger att S1 kan utföra tidigare osedda uppgifter i flera steg, i upp till tio minuter, efter att ha sett en enda video – utan finjustering eller en ny träningsomgång. Videon fungerar som en instruktion i realtid: S1 tolkar målet och kombinerar färdigheter som modellen lärt sig under förträningen till hand...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI vill göra robotprogrammering mer likt att lära ut genom att visa ett exempel. En människa demonstrerar en uppgift i en video, och robotmodellen S1 använder demonstrationen som en visuell instruktion – i stället för att starta en ny, uppgiftsspecifik träningsomgång. Enligt Skild kan S1 hantera tidigare osedda uppgifter med flera steg och en varaktighet på upp till tio minuter, utan finjustering eller en separat träningsfas efter observationen. 1
Det är en viktig skillnad mot traditionell robotik, där nya arbetsuppgifter ofta kräver stora mängder data, fjärrstyrning, ingenjörsarbete eller omskolning. S1 ska inte memorera videon bild för bild. Tanken är att modellen tolkar målet och sätter samman färdigheter den redan lärt sig till en ny serie handlingar.
S1 använder visuell in-context learning, eller kontextbaserat lärande. Den mänskliga demonstrationen fungerar som en uppgiftsprompt när modellen används. S1 observerar vad som händer, drar slutsatser om målet och ordningen mellan momenten och översätter sedan informationen till robotens handlingar i den aktuella miljön. Enligt Skild ändras inte modellens vikter för varje ny demonstration. 1
Det liknar mer att visa ett AI-system vad det ska göra än att träna en robot från grunden. Modellen behöver koppla synintryck till färdigheter som att greppa, flytta, placera och manipulera föremål – och därefter ordna dem i en längre procedur. Skilds offentliga exempel omfattar pour-over-kaffe, plantering i kruka, montering av ett kit och pannkaksstekning. 135
Den stora utmaningen är långa uppgiftsförlopp. En enskild rörelse kan ofta skriptas eller läras in separat. En tio minuter lång uppgift kan däremot innehålla dussintals beslut, föremål som flyttar sig och flera möjligheter att göra fel. S1 är tänkt att hålla fast vid uppgiftens mål under hela förloppet och anpassa rörelserna efter miljön, snarare än att bara upprepa demonstratörens exakta rörelser.
Skild rapporterar en tydlig skillnad mellan videopromptning och språkpromptning i ett test av tidigare osedda uppgifter. Vid den angivna träningsskalan på 100 000 timmar nådde den videostyrda modellen en genomsnittlig framgång per steg på 66 procent, jämfört med 9 procent för en jämförbar språkstyrd vision-language-action-modell. 32
Resultatet antyder att en videodemonstration kan förmedla fysiska detaljer som ord inte alltid fångar: vilket föremål som ska greppas, hur det ska orienteras, i vilken ordning momenten ska utföras och hur demonstratören reagerar på omgivningen.
Siffran bör dock tolkas försiktigt. Det handlar om Skilds egen rapporterade utvärdering, inte om ett oberoende upprepat branschtest. Dessutom är 66 procent ett mått per steg – inte en garanti för att roboten klarar 66 procent av en hel tio minuter lång uppgift från början till slut.
De offentliga demonstrationerna omfattar bland annat:
Exemplen är intressanta eftersom de kombinerar synförmåga, föremålshantering, rätt ordningsföljd och långvarig kontroll. Skild beskriver uppgifterna som sådana modellen inte mött under förträningen, även om det tillgängliga underlaget främst består av företagets egna uppgifter och rapporter som återger dem. 133
Demonstrationerna visar det tänkta gränssnittet: en människa utför uppgiften en gång och roboten försöker generalisera proceduren. De bevisar däremot inte att S1 pålitligt kan utföra godtyckliga hushållssysslor, arbeta utan övervakning eller hantera alla fysiska variationer i en produktionsmiljö.
S1:s utlovade fördel är att roboten kan börja agera efter att ha sett demonstrationen, utan en separat träningsfas efteråt. Skild och rapporteringen om lanseringen beskriver detta som realtidsbaserad in-context-exekvering. 130
De tillgängliga källorna anger däremot ingen tillförlitlig, exakt fördröjning – exempelvis hur många sekunder som går från att videon tar slut tills roboten gör sin första rörelse. Att modellen inte finjusteras betyder att den inte genomgår en ny uppgiftsspecifik uppdatering av modellvikterna. Det betyder inte nödvändigtvis att varje video behandlas omedelbart eller att roboten klarar sig utan kalibrering, förberedelser och säkerhetskontroller.
S1 är en del av Skilds större Skild Brain-strategi. Målet är att träna en generell modell över uppgifter, robottyper, simuleringar och visuella data från människor, i stället för att bygga en separat policy för varje robot och arbetsmoment. Skild uppger att företaget har skapat en simulerad värld med 100 000 robotvarianter och testat hur modellen generaliserar till robotkroppar som inte ingick i träningsmaterialet. 6
Träning över olika robotkroppar ska ge modellen mer allmänna principer för styrning. Skild beskriver ett system som ska fungera med humanoida robotar, fyrbenta robotar, stationära robotarmar och mobila manipulatorer. 310
Påståenden om att Skild skulle ha 100–1 000 gånger mer data än konkurrenterna bör däremot behandlas med försiktighet. De tillgängliga källorna innehåller ingen standardiserad och oberoende granskbar jämförelse av datamängdernas storlek, kvalitet eller användbara roboterfarenhet mellan företag. Den mer hållbara slutsatsen är att Skild satsar på skala genom träning över flera robotkroppar och simulering, i stället för att enbart förlita sig på specialanpassade demonstrationer för en enda hårdvaruplattform.
”Omni-bodied” är Skilds begrepp för en modell som ska kunna överföras mellan olika robotkroppar. I princip kan en gemensam modell lära sig uppgiftsrelaterade koncept utan att vara bunden till en viss robots exakta geometri. Det skulle göra det lättare att anpassa den till olika leder, hjul, gripdon och motorlösningar. Skild uppger att simuleringstesterna omfattade robotformer som hölls utanför träningen och styrdes nollskottsmässigt, alltså utan att modellen tränats specifikt på dem. 6
Det gör inte hårdvaran oviktig. Robotar har fortfarande olika sensorer, gripdon, ledbegränsningar, styrgränssnitt, fördröjningar, lyftkapacitet och säkerhetskrav. En modell som generaliserar mellan robotkroppar kan minska anpassningsarbetet, men driftsättning kräver fortfarande kompatibel hårdvara, systemintegration och tester i den miljö där roboten ska användas.
Offentlig rapportering uppger att Skilds mjukvara körs på hundratals robotar i fabriker, datacenter och logistikmiljöer. Rapporterade exempel är Nvidias fabrik i Houston, ett försök på LaGuardia-flygplatsen och arbete tillsammans med företag inom kabeldragning och bygg. Skild har också meddelat samarbeten med ABB Robotics, Universal Robots och Nvidia. 174
Det pekar på kommersiellt intresse och tester i verkliga miljöer, men det finns inte tillräckligt med offentliga uppgifter för att räkna fram oberoende verifierade siffror för produktionsgrad, drifttid, kostnadsbesparingar eller avkastning på investeringar. Ett resultat från ett laboratorium eller en kontrollerad utvärdering ska inte förväxlas med ett produktionsmått.
En rapport beskriver även en planerad insats tillsammans med Foxconn på monteringslinjer kopplade till Nvidias Blackwell-servrar. Det är belägg för ett test- eller driftsättningsarbete – inte för att autonoma robotar redan sköter fabriksproduktion i bred skala. 43
Skilds finansiering har gjort företaget till ett av de mest bevakade bolagen inom fysisk AI. Bloomberg rapporterade att företaget i januari 2026 tog in omkring 1,4 miljarder dollar i en Series C-runda ledd av SoftBank, till en värdering på över 14 miljarder dollar. 13 Den tidigare Series A-rundan, som offentliggjordes i juli 2024, uppgick till 300 miljoner dollar och värderade bolaget till omkring 1,5 miljarder dollar. 9
Liknelsen med en ”ChatGPT-stund” beskriver den förändring i användarupplevelse som branschen hoppas på: i stället för att programmera eller träna om en robot för varje uppgift skulle en arbetare kunna visa det önskade beteendet och låta en generell modell översätta det till handlingar. S1 är ett tydligt steg mot ett sådant gränssnitt.
Det är däremot ännu inget bevis på att generalistrobotar har blivit verklighet. De starkaste offentliga resultaten kommer från företaget självt, uppgiftsurvalet är begränsat och oberoende verifierade industrimått saknas i det tillgängliga underlaget. Den mer försiktiga slutsatsen är att S1 visar ett lovande sätt att minska behovet av uppgiftsspecifik robotträning: använd en video som instruktion, låt bred förträning bidra med återanvändbara färdigheter och testa om dessa kan kombineras till en ny, lång uppgift.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI uppger att S1 kan utföra tidigare osedda uppgifter i flera steg, i upp till tio minuter, efter att ha sett en enda video – utan finjustering eller en ny träningsomgång.
Skild AI uppger att S1 kan utföra tidigare osedda uppgifter i flera steg, i upp till tio minuter, efter att ha sett en enda video – utan finjustering eller en ny träningsomgång. Videon fungerar som en instruktion i realtid: S1 tolkar målet och kombinerar färdigheter som modellen lärt sig under förträningen till handlingar i robotens aktuella miljö.
I ett företagsrapporterat test nådde den videostyrda modellen 66 procents genomsnittlig framgång per steg, jämfört med 9 procent för en jämförbar språkstyrd modell.