Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde. S1 gebruikt de video als instructie tijdens het uitvoeren van de taak en combineert eerder geleerde vaardigheden zoals grijpen, verplaatsen en plaatsen.
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI wil robots niet langer voor elke nieuwe taak apart laten programmeren of trainen. Met S1 moet een menselijke demonstratie volstaan: iemand doet een taak voor in een video, waarna het model probeert die taak zelf uit te voeren. Volgens Skild kan dat ook bij eerder ongeziene, meerstapstaken die tot tien minuten duren, zonder fine-tuning of een aparte trainingsfase na het bekijken van de video. 1
Dat is een belangrijk verschil met veel traditionele robotsystemen. Die hebben vaak specifieke data, teleoperatie, technische configuratie of een nieuwe trainingsronde nodig voordat ze een andere handeling aankunnen. S1 probeert in plaats daarvan het doel uit de video af te leiden en vaardigheden die het eerder heeft geleerd samen te voegen tot een nieuwe reeks acties.
S1 gebruikt wat Skild visueel in-context leren noemt. De menselijke demonstratie fungeert tijdens het uitvoeren van de taak als een visuele prompt. Het model bekijkt wat er gebeurt, leidt de bedoeling en de volgorde van handelingen af en vertaalt die informatie naar acties in de huidige omgeving. Volgens Skild worden de modelgewichten daarbij niet voor elke nieuwe demonstratie aangepast. 1
Het gaat dus eerder om laten zien wat de bedoeling is dan om een robot opnieuw te trainen. S1 moet visuele waarnemingen koppelen aan vaardigheden die al tijdens de voortraining zijn geleerd, zoals grijpen, bewegen, neerzetten en objecten manipuleren. Vervolgens moet het die vaardigheden in de juiste volgorde combineren. Publiek getoonde voorbeelden zijn onder meer pour-overkoffie zetten, een plant oppotten, een kit assembleren en pannenkoeken omdraaien. 1
35
De grootste uitdaging is de lange tijdshorizon. Een korte beweging kan relatief eenvoudig worden geprogrammeerd; een taak van tien minuten kan tientallen beslissingen, verschuivende objecten en meerdere momenten waarop iets misgaat bevatten. S1 is bedoeld om het einddoel gedurende die hele reeks vast te houden en zich aan de omgeving aan te passen, in plaats van de bewegingen uit de video simpelweg beeld voor beeld na te doen.
Skild meldt een groot verschil tussen video- en taalprompts in zijn test met onbekende taken. Bij een genoemde trainingsschaal van 100.000 uur behaalde het videoge stuurde beleid een gemiddelde succesratio van 66% per stap, tegenover 9% voor een vergelijkbaar taalgestuurd vision-language-actionbeleid. 32
Een video kan fysieke details overbrengen die in woorden gemakkelijk vaag blijven: welk object moet worden vastgepakt, hoe het moet worden gedraaid, welke handeling eerst komt en hoe de demonstrator reageert op de situatie. Toch vraagt het cijfer om nuance. Het gaat om een door Skild gerapporteerde evaluatie en niet om een onafhankelijk herhaalde industriestandaard. Bovendien betekent een succesratio per stap niet dat een taak van tien minuten met 66% zekerheid volledig wordt afgerond.
De openbare voorbeelden omvatten onder meer:
Deze taken combineren waarneming, objecthantering, volgorde en langdurige besturing. Daarmee testen ze meer dan één geïsoleerde beweging. Skild beschrijft de taken als voorbeelden die niet in de voortraining voorkwamen, al is het beschikbare bewijs vooral gebaseerd op informatie van het bedrijf en berichtgeving die de claims samenvat. 1
33
De demonstraties laten vooral de beoogde interface zien: een mens voert een taak één keer uit en de robot probeert de procedure te veralgemeniseren. Ze bewijzen niet dat S1 willekeurige huishoudelijke taken betrouwbaar kan uitvoeren, zonder toezicht kan werken of met elke fysieke variatie in een productieomgeving overweg kan.
Het geclaimde voordeel van S1 is dat de robot na het bekijken van de demonstratie direct kan beginnen, zonder aparte trainingsfase achteraf. Skild en berichtgeving over de introductie omschrijven dit als realtime uitvoering via in-context leren. 1
30
De beschikbare bronnen geven echter geen betrouwbare, precieze latentie—bijvoorbeeld hoeveel seconden er zitten tussen het einde van de video en de eerste robotbeweging. “Geen fine-tuning” betekent dat het model geen nieuwe, taakgerichte update van zijn gewichten krijgt. Het betekent niet automatisch dat iedere video onmiddellijk wordt verwerkt of dat voorbereiding, kalibratie en veiligheidscontroles overbodig zijn.
S1 maakt deel uit van de bredere Skild Brain-strategie. Skild wil één algemeen model trainen op verschillende taken, robotlichamen, simulaties en visuele gegevens van mensen, in plaats van voor iedere robot en iedere opdracht een afzonderlijk beleid te bouwen. Het bedrijf zegt een gesimuleerd universum met 100.000 robotvarianten te hebben gemaakt en te hebben getest of het model kan generaliseren naar robotlichamen die niet in de trainingsset zaten. 6
Door robots met verschillende fysieke vormen tegelijk te trainen, probeert Skild algemene regels voor besturing te leren. Het bedrijf beschrijft een systeem voor onder meer humanoïde robots, viervoeters, robotarmen op tafel en mobiele manipulatoren. 3
10
Claims dat Skild 100 tot 1.000 keer meer data heeft dan concurrenten moeten voorzichtig worden geïnterpreteerd. De beschikbare bronnen bieden geen gestandaardiseerde, onafhankelijk controleerbare vergelijking van datasetgrootte, datakwaliteit of bruikbare robotervaring tussen bedrijven. De beter onderbouwde conclusie is dat Skild inzet op schaal via simulatie en training over meerdere robotvormen, in plaats van uitsluitend op maat gemaakte demonstraties voor één hardwareplatform.
“Omni-bodied” is Skilds term voor een model dat tussen verschillende robotlichamen moet kunnen worden overgedragen. In theorie kan een gedeeld model taakbegrippen loskoppelen van de exacte geometrie van één machine. Daardoor zou het zich kunnen aanpassen aan verschillende ledematen, wielen, grijpers en actuatorindelingen. Skild zegt dat het in simulaties ook niet eerder geziene robotvormen zero-shot heeft aangestuurd. 6
Daarmee wordt hardware niet ineens onbelangrijk. Robots verschillen nog steeds in sensoren, grijpers, gewrichtslimieten, besturingsinterfaces, vertraging, draagvermogen en veiligheidsvoorwaarden. Een model dat tussen robotlichamen generaliseert, kan de benodigde aanpassing verminderen, maar inzet in de praktijk vraagt nog altijd om geschikte hardware, systeemintegratie en validatie in de doelomgeving.
Volgens openbare berichtgeving draait de software van Skild op honderden robots in fabrieken, datacenters en logistieke omgevingen. Genoemde voorbeelden zijn de fabriek van NVIDIA in Houston, een proef in LaGuardia en samenwerking met bedrijven in de bedrading- en bouwsector. Skild heeft daarnaast relaties aangekondigd met ABB Robotics, Universal Robots en NVIDIA. 17
4
Dat wijst op commerciële belangstelling en tests in de echte wereld, maar er is onvoldoende openbare informatie om onafhankelijk vastgestelde productiecijfers, uptime, kostenbesparingen of rendement op investering te berekenen. Een resultaat uit een laboratorium of gecontroleerde evaluatie mag niet als productiemaatstaf worden gelezen. Een rapport beschrijft ook een geplande inzet met Foxconn op assemblagelijnen voor NVIDIA Blackwell-gpu-servers. Dat is bewijs van een test- of implementatie-inspanning, niet van grootschalige autonome fabrieksproductie. 43
De financiële steun voor Skild heeft het bedrijf tot een van de opvallendste spelers in fysieke AI gemaakt. Bloomberg meldde dat Skild in januari 2026 ongeveer 1,4 miljard dollar ophaalde in een door SoftBank geleide Series C, bij een waardering van meer dan 14 miljard dollar. 13 De eerder aangekondigde Series A bedroeg in juli 2024 300 miljoen dollar, bij een gemelde waardering van 1,5 miljard dollar.
9
De vergelijking met een “ChatGPT-moment” beschrijft vooral de gehoopte verandering in gebruikservaring. In plaats van een robot voor elke taak te programmeren of opnieuw te trainen, zou een medewerker het gewenste gedrag kunnen voordoen en een algemeen model de vertaling naar robotacties laten maken. S1 is een duidelijke stap in de richting van zo’n interface.
Het model bewijst daarmee nog niet dat algemene robots klaar zijn voor ieder huishouden of elke fabriek. De sterkste openbare resultaten komen van het bedrijf zelf, de reeks getoonde taken is beperkt en onafhankelijk gecontroleerde industriële cijfers ontbreken in de beschikbare informatie. De meest voorzichtige conclusie is dat S1 een veelbelovende manier laat zien om taakgerichte robottraining te verminderen: gebruik een video als instructie, haal herbruikbare vaardigheden uit brede voortraining en test vervolgens of die vaardigheden kunnen worden gecombineerd tot een nieuwe taak met een lange reeks handelingen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde.
Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde. S1 gebruikt de video als instructie tijdens het uitvoeren van de taak en combineert eerder geleerde vaardigheden zoals grijpen, verplaatsen en plaatsen.
Skild rapporteert een gemiddelde stap succesratio van 66% voor video geprompte S1, tegenover 9% voor een vergelijkbaar taalgestuurd vision language action model.
Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde. S1 gebruikt de video als instructie tijdens het uitvoeren van de taak en combineert eerder geleerde vaardigheden zoals grijpen, verplaatsen en plaatsen.
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI wil robots niet langer voor elke nieuwe taak apart laten programmeren of trainen. Met S1 moet een menselijke demonstratie volstaan: iemand doet een taak voor in een video, waarna het model probeert die taak zelf uit te voeren. Volgens Skild kan dat ook bij eerder ongeziene, meerstapstaken die tot tien minuten duren, zonder fine-tuning of een aparte trainingsfase na het bekijken van de video. 1
Dat is een belangrijk verschil met veel traditionele robotsystemen. Die hebben vaak specifieke data, teleoperatie, technische configuratie of een nieuwe trainingsronde nodig voordat ze een andere handeling aankunnen. S1 probeert in plaats daarvan het doel uit de video af te leiden en vaardigheden die het eerder heeft geleerd samen te voegen tot een nieuwe reeks acties.
S1 gebruikt wat Skild visueel in-context leren noemt. De menselijke demonstratie fungeert tijdens het uitvoeren van de taak als een visuele prompt. Het model bekijkt wat er gebeurt, leidt de bedoeling en de volgorde van handelingen af en vertaalt die informatie naar acties in de huidige omgeving. Volgens Skild worden de modelgewichten daarbij niet voor elke nieuwe demonstratie aangepast. 1
Het gaat dus eerder om laten zien wat de bedoeling is dan om een robot opnieuw te trainen. S1 moet visuele waarnemingen koppelen aan vaardigheden die al tijdens de voortraining zijn geleerd, zoals grijpen, bewegen, neerzetten en objecten manipuleren. Vervolgens moet het die vaardigheden in de juiste volgorde combineren. Publiek getoonde voorbeelden zijn onder meer pour-overkoffie zetten, een plant oppotten, een kit assembleren en pannenkoeken omdraaien. 1
35
De grootste uitdaging is de lange tijdshorizon. Een korte beweging kan relatief eenvoudig worden geprogrammeerd; een taak van tien minuten kan tientallen beslissingen, verschuivende objecten en meerdere momenten waarop iets misgaat bevatten. S1 is bedoeld om het einddoel gedurende die hele reeks vast te houden en zich aan de omgeving aan te passen, in plaats van de bewegingen uit de video simpelweg beeld voor beeld na te doen.
Skild meldt een groot verschil tussen video- en taalprompts in zijn test met onbekende taken. Bij een genoemde trainingsschaal van 100.000 uur behaalde het videoge stuurde beleid een gemiddelde succesratio van 66% per stap, tegenover 9% voor een vergelijkbaar taalgestuurd vision-language-actionbeleid. 32
Een video kan fysieke details overbrengen die in woorden gemakkelijk vaag blijven: welk object moet worden vastgepakt, hoe het moet worden gedraaid, welke handeling eerst komt en hoe de demonstrator reageert op de situatie. Toch vraagt het cijfer om nuance. Het gaat om een door Skild gerapporteerde evaluatie en niet om een onafhankelijk herhaalde industriestandaard. Bovendien betekent een succesratio per stap niet dat een taak van tien minuten met 66% zekerheid volledig wordt afgerond.
De openbare voorbeelden omvatten onder meer:
Deze taken combineren waarneming, objecthantering, volgorde en langdurige besturing. Daarmee testen ze meer dan één geïsoleerde beweging. Skild beschrijft de taken als voorbeelden die niet in de voortraining voorkwamen, al is het beschikbare bewijs vooral gebaseerd op informatie van het bedrijf en berichtgeving die de claims samenvat. 1
33
De demonstraties laten vooral de beoogde interface zien: een mens voert een taak één keer uit en de robot probeert de procedure te veralgemeniseren. Ze bewijzen niet dat S1 willekeurige huishoudelijke taken betrouwbaar kan uitvoeren, zonder toezicht kan werken of met elke fysieke variatie in een productieomgeving overweg kan.
Het geclaimde voordeel van S1 is dat de robot na het bekijken van de demonstratie direct kan beginnen, zonder aparte trainingsfase achteraf. Skild en berichtgeving over de introductie omschrijven dit als realtime uitvoering via in-context leren. 1
30
De beschikbare bronnen geven echter geen betrouwbare, precieze latentie—bijvoorbeeld hoeveel seconden er zitten tussen het einde van de video en de eerste robotbeweging. “Geen fine-tuning” betekent dat het model geen nieuwe, taakgerichte update van zijn gewichten krijgt. Het betekent niet automatisch dat iedere video onmiddellijk wordt verwerkt of dat voorbereiding, kalibratie en veiligheidscontroles overbodig zijn.
S1 maakt deel uit van de bredere Skild Brain-strategie. Skild wil één algemeen model trainen op verschillende taken, robotlichamen, simulaties en visuele gegevens van mensen, in plaats van voor iedere robot en iedere opdracht een afzonderlijk beleid te bouwen. Het bedrijf zegt een gesimuleerd universum met 100.000 robotvarianten te hebben gemaakt en te hebben getest of het model kan generaliseren naar robotlichamen die niet in de trainingsset zaten. 6
Door robots met verschillende fysieke vormen tegelijk te trainen, probeert Skild algemene regels voor besturing te leren. Het bedrijf beschrijft een systeem voor onder meer humanoïde robots, viervoeters, robotarmen op tafel en mobiele manipulatoren. 3
10
Claims dat Skild 100 tot 1.000 keer meer data heeft dan concurrenten moeten voorzichtig worden geïnterpreteerd. De beschikbare bronnen bieden geen gestandaardiseerde, onafhankelijk controleerbare vergelijking van datasetgrootte, datakwaliteit of bruikbare robotervaring tussen bedrijven. De beter onderbouwde conclusie is dat Skild inzet op schaal via simulatie en training over meerdere robotvormen, in plaats van uitsluitend op maat gemaakte demonstraties voor één hardwareplatform.
“Omni-bodied” is Skilds term voor een model dat tussen verschillende robotlichamen moet kunnen worden overgedragen. In theorie kan een gedeeld model taakbegrippen loskoppelen van de exacte geometrie van één machine. Daardoor zou het zich kunnen aanpassen aan verschillende ledematen, wielen, grijpers en actuatorindelingen. Skild zegt dat het in simulaties ook niet eerder geziene robotvormen zero-shot heeft aangestuurd. 6
Daarmee wordt hardware niet ineens onbelangrijk. Robots verschillen nog steeds in sensoren, grijpers, gewrichtslimieten, besturingsinterfaces, vertraging, draagvermogen en veiligheidsvoorwaarden. Een model dat tussen robotlichamen generaliseert, kan de benodigde aanpassing verminderen, maar inzet in de praktijk vraagt nog altijd om geschikte hardware, systeemintegratie en validatie in de doelomgeving.
Volgens openbare berichtgeving draait de software van Skild op honderden robots in fabrieken, datacenters en logistieke omgevingen. Genoemde voorbeelden zijn de fabriek van NVIDIA in Houston, een proef in LaGuardia en samenwerking met bedrijven in de bedrading- en bouwsector. Skild heeft daarnaast relaties aangekondigd met ABB Robotics, Universal Robots en NVIDIA. 17
4
Dat wijst op commerciële belangstelling en tests in de echte wereld, maar er is onvoldoende openbare informatie om onafhankelijk vastgestelde productiecijfers, uptime, kostenbesparingen of rendement op investering te berekenen. Een resultaat uit een laboratorium of gecontroleerde evaluatie mag niet als productiemaatstaf worden gelezen. Een rapport beschrijft ook een geplande inzet met Foxconn op assemblagelijnen voor NVIDIA Blackwell-gpu-servers. Dat is bewijs van een test- of implementatie-inspanning, niet van grootschalige autonome fabrieksproductie. 43
De financiële steun voor Skild heeft het bedrijf tot een van de opvallendste spelers in fysieke AI gemaakt. Bloomberg meldde dat Skild in januari 2026 ongeveer 1,4 miljard dollar ophaalde in een door SoftBank geleide Series C, bij een waardering van meer dan 14 miljard dollar. 13 De eerder aangekondigde Series A bedroeg in juli 2024 300 miljoen dollar, bij een gemelde waardering van 1,5 miljard dollar.
9
De vergelijking met een “ChatGPT-moment” beschrijft vooral de gehoopte verandering in gebruikservaring. In plaats van een robot voor elke taak te programmeren of opnieuw te trainen, zou een medewerker het gewenste gedrag kunnen voordoen en een algemeen model de vertaling naar robotacties laten maken. S1 is een duidelijke stap in de richting van zo’n interface.
Het model bewijst daarmee nog niet dat algemene robots klaar zijn voor ieder huishouden of elke fabriek. De sterkste openbare resultaten komen van het bedrijf zelf, de reeks getoonde taken is beperkt en onafhankelijk gecontroleerde industriële cijfers ontbreken in de beschikbare informatie. De meest voorzichtige conclusie is dat S1 een veelbelovende manier laat zien om taakgerichte robottraining te verminderen: gebruik een video als instructie, haal herbruikbare vaardigheden uit brede voortraining en test vervolgens of die vaardigheden kunnen worden gecombineerd tot een nieuwe taak met een lange reeks handelingen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde.
Volgens Skild AI kan S1 onbekende taken van maximaal tien minuten uitvoeren na het bekijken van één menselijke video, zonder fine tuning of een nieuwe trainingsronde. S1 gebruikt de video als instructie tijdens het uitvoeren van de taak en combineert eerder geleerde vaardigheden zoals grijpen, verplaatsen en plaatsen.
Skild rapporteert een gemiddelde stap succesratio van 66% voor video geprompte S1, tegenover 9% voor een vergelijkbaar taalgestuurd vision language action model.