Skild AI tvrdí, že S1 dokáže z jediného videa pochopit dosud neznámý úkol trvající až 10 minut, aniž by bylo nutné měnit váhy modelu nebo sbírat data specifická pro daný úkol. V ukázkách S1 připravoval překapávanou kávu, přesazoval rostlinu, sestavoval sadu a obracel palačinku; podle firmy se dokázal přizpůsobit změ...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI představila model S1, který má robotům umožnit učit se nové úkoly podobně, jako se jazykové modely učí z kontextu. Robot nejprve sleduje video s ukázkou činnosti a poté se ji pokusí provést — bez dolaďování pro konkrétní úkol a bez změny vah modelu. Skild uvádí, že S1 zvládne i dosud neznámé úkoly trvající až 10 minut. 1
5
Jde o zajímavý krok směrem k adaptivnější fyzické umělé inteligenci. Zároveň ale není důvod tvrdit, že univerzální roboti jsou připraveni bez omezení pracovat v domácnostech nebo továrnách. Nejsilnější výsledky zatím pocházejí z ukázek, interních testů a materiálů samotné Skild AI. Nezávislé ověření proto bude klíčové.
Mnoho robotických systémů se trénuje pro konkrétní úkol, konkrétní typ robota nebo přesně vymezené provozní podmínky. S1 se místo toho snaží zacházet s demonstračním videem jako s vykonatelným zadáním. Z něj má odvodit cíl, pořadí kroků, vztahy mezi předměty i fyzické úpravy potřebné k dokončení činnosti. 1
3
Rozdíl oproti prostému příkazu typu „uvař kávu“ nebo „přesuň květinu“ je podstatný. Jazyk může popsat výsledek, video však ukazuje také sled operací, způsob uchopení předmětu, používání nástrojů, rozmístění věcí a tempo práce. Právě tato informace má S1 pomáhat s dlouhými úkoly, které nebyly součástí předtrénování. 1
5
Skild tento přístup popisuje jako robotickou obdobu promptování jazykového modelu: základní schopnosti modelu zůstávají stejné, zatímco video dodá kontext pro konkrétní úkol.
Skild AI ukázala S1 při několika manipulačních úkolech, mimo jiné při:
Některé ukázky trvají až 10 minut a zahrnují desítky kroků za sebou. 1
3
5
Firma zveřejnila také kvalitativní testy, které měly ukázat, že S1 pouze nepřehrává naučený pohyb. Podle Skild se model dokázal vypořádat se změnami ve scéně, po některých chybách úkon zopakoval, místo konve použil dostupný kelímek a u nepovedené manipulace s vejcem opravil postup demonstrátora, místo aby jej slepě kopíroval. To jsou slibné známky flexibility, samotná videa však nepotvrzují spolehlivost v široké škále prostředí. 5
Nejkonkrétnější srovnání, které Skild uvádí, pochází z interního testu dosud neviděných úkolů. Při 100 000 hodinách trénovacích dat firma naměřila u video-promptované politiky založené na učení v kontextu 66% průměrnou úspěšnost jednotlivých kroků. Srovnatelný model VLA řízený jazykem dosáhl podle Skild 9 %. VLA je zkratka pro model typu vision-language-action, tedy systém propojující obraz, jazyk a akci. 1
4
Skild rovněž uvádí, že při výrazné změně podmínek nasazení se jazykem řízený model zhoršil až třikrát více než S1. Šlo například o situace, kdy se předměty lišily od těch v demonstračním videu nebo kdy bylo nutné provést plán opačnou rukou. 1
Další firemní odhad přirovnává výkon po jediném video promptu přibližně k výkonu, kterého by předtrénovaný model dosáhl po zhruba 380 epizodách dolaďování pro konkrétní úkol. 1
Čísla ukazují, proč by video jako instrukce mohlo být důležité. Neříká totiž pouze, čeho má robot dosáhnout, ale také v jakém pořadí, s jakým načasováním, v jakém rozmístění předmětů a jakou fyzickou strategií. Výsledky je však třeba chápat jako interní důkazy Skild AI, nikoli jako nezávisle zopakovaný standardizovaný benchmark. Dodané materiály neobsahují veřejný odborný článek, váhy modelu ani externí srovnávací test. 4
15
Skild popisuje S1 jako systém pracující po zhlédnutí ukázky v reálném čase. Zprávy kolem uvedení modelu uváděly, že robot může začít úkol provádět bezprostředně po zhlédnutí videa. 2
5
Z dostupných podkladů ale nelze ověřit obecné tvrzení typu „během několika sekund“ ani přesný čas od konce videa do zahájení práce. Konkrétní latence tedy není doložena. V průmyslu přitom může být stejně důležitá jako samotná úspěšnost úkolu — například kvůli době přípravy, výpočetní odezvě, bezpečnostním kontrolám a zvládání chyb.
Skild připisuje svou snahu vytvořit obecnější robotický model široké datové infrastruktuře. Firma popisuje využití rozsáhlých simulací, internetových videí lidských činností, robotických dat, teleoperace a informací z reálného nasazení. Materiály k investičnímu kolu Series C hovoří také o datové smyčce: každé nasazení má generovat další zkušenosti, které mohou model zlepšit napříč roboty a prostředími. 37
Spoluzakladatel Abhinav Gupta podle zpráv z konference SMARTCLOUD SHOW uvedl, že Skild využívá „všechny druhy“ sběru robotických dat a nashromáždila 100- až 1 000krát více dat než konkurence. Tento násobek je tvrzením společnosti, nikoli veřejně auditovaným srovnáním celého odvětví. 6
Jednotlivé zdroje dat přitom plní různé role: lidská videa ukazují objekty a činnosti, simulace rozšiřují množství robotických těl a prostředí a data z reálných robotů propojují tyto znalosti s fyzickým řízením.
S1 zapadá do širší strategie Skild AI označované jako omni-bodied robotický mozek. Neznamená to, že dvounohý, čtyřnohý, kolový robot a robotické rameno budou provádět stejné pohyby. Liší se klouby, senzory, končetinami, koly i fyzicky proveditelnými akcemi. 45
Smyslem je naučit model obecné zákonitosti fyzického světa, které lze přenést mezi platformami, a následně je přizpůsobit schopnostem konkrétního robota. Jeden model tak může sdílet znalosti napříč různými konstrukcemi, ale výstupy přizpůsobit dostupným pohonům a senzorům. 45
Cílem je omezit potřebu vytvářet a udržovat samostatný model pro každou konfiguraci robota. Skild také uvádí, že při trénování pracovala s velkým množstvím simulovaných robotických těl, aby se model naučil obecnější fyzické chování. 42
45
Skild oznámila spolupráci se společnostmi ABB Robotics a Universal Robots, jejichž průmyslové systémy má její software podporovat. Reuters zároveň informoval o nasazení robotického „mozku“ Skild a společnosti Nvidia na montážních linkách spojených se systémy Nvidia Blackwell. 34
44
Tato oznámení ukazují cestu ke komerčnímu testování, neposkytují však úplný veřejný obraz výsledků. Z dodaných zdrojů nevyplývají nezávisle auditované údaje o průchodnosti výroby, dostupnosti systému, chybovosti, bezpečnostních incidentech ani návratnosti investice. Nasazení je důkazem testování nebo integrace — nikoli potvrzením, že technologie už ve velkém nahradila konvenční automatizaci.
Zájem investorů o Skild AI je značný. Bloomberg uvedl, že firma získala v kole Series C vedeném SoftBank přibližně 1,4 miliardy dolarů a její valuace přesáhla 14 miliard dolarů. To znamenalo více než ztrojnásobení hodnoty během zhruba sedmi měsíců. 17
Financování odráží přesvědčení, že robotický software by se mohl stát škálovatelnou platformovou vrstvou pro mnoho typů hardwaru. Odhady celkového financování Skild se podle zdroje liší; některé zprávy hovoří o více než 1,8 miliardy dolarech. Dostupná čísla proto nelze vydávat za definitivní auditovaný součet. 18
21
22
Přirovnání ke „ chvíli ChatGPT pro roboty“ je zatím třeba chápat jako analogii, nikoli jako uzavřený závěr. S1 naznačuje možný posun od přeškolování robotů pro každý jednotlivý úkol k učení z demonstrací. Investor Ravi Mhatre uvedení označil za „moment GPT-3“ pro dlouhé úkoly spojené s lidskou prací, jde však o názor investora, nikoli o nezávislé vědecké ověření. 10
Nejdůležitější myšlenkou S1 není pouze to, že robot dokáže napodobit video. Jde o ambici, aby základní model z jediné ukázky sestavil potřebné dovednosti, přizpůsobil se změněné scéně a zvládl dlouhou sekvenci bez úpravy vah pro konkrétní úkol.
Skild uváděný výsledek 66 % oproti 9 % i demonstrace desetiminutových úkolů jsou technicky významné. 1
4 Stejně důležitá je však brzda: veřejné důkazy stále stojí především na materiálech společnosti, vybraných ukázkách a prvních oznámeních o nasazení. Dokud výsledky nezopakují nezávislí výzkumníci ve standardizovaných podmínkách a průmysloví zákazníci nezveřejní údaje o spolehlivosti a bezpečnosti, je rozumnější vnímat S1 jako slibný směr fyzické AI než jako definitivní důkaz, že univerzální robotický mozek už dorazil.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI tvrdí, že S1 dokáže z jediného videa pochopit dosud neznámý úkol trvající až 10 minut, aniž by bylo nutné měnit váhy modelu nebo sbírat data specifická pro daný úkol.
Skild AI tvrdí, že S1 dokáže z jediného videa pochopit dosud neznámý úkol trvající až 10 minut, aniž by bylo nutné měnit váhy modelu nebo sbírat data specifická pro daný úkol. V ukázkách S1 připravoval překapávanou kávu, přesazoval rostlinu, sestavoval sadu a obracel palačinku; podle firmy se dokázal přizpůsobit změnám ve scéně a zotavit se z některých chyb.
Technologie míří také do průmyslu, veřejně dostupné informace však zatím nepotvrzují výrobní metriky, jako jsou dostupnost, propustnost, chybovost, bezpečnost nebo návratnost investice.