Skild AI tvrdí, že S1 dokáže po zhlédnutí jediného videa provádět dosud neznámé vícekrokové úkoly trvající až 10 minut, a to bez fine tuningu; v interním testu dosáhl 66% úspěšnosti jednotlivých kroků oproti 9 % u jaz... Video slouží jako instrukce při samotném použití modelu.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI chce programování robotů přiblížit učení nápodobou. Člověk předvede úkol na videu a model S1 použije tuto ukázku jako vizuální instrukci. Podle popisu společnosti pak dokáže provést i dosud neznámé vícekrokové manipulační úkoly trvající až 10 minut — bez nového trénovacího běhu, fine-tuningu nebo dodatečného učení po zhlédnutí videa. 1
Nejde o prosté přehrání pohybů z videa. S1 se má pokusit pochopit cíl úkolu a poskládat dříve naučené schopnosti do nové posloupnosti akcí, která odpovídá aktuálnímu prostředí robota.
S1 využívá takzvané vizuální učení v kontextu (visual in-context learning). Demonstrace člověka funguje při použití modelu jako zadání. S1 sleduje, co se děje, odhaduje zamýšlený cíl i pořadí kroků a převádí tyto informace na příkazy pro konkrétního robota. Podle Skild AI se při každé nové ukázce nemění parametry modelu. 1
Je to tedy blíže názornému předvedení než klasickému programování robota. Model musí propojit obrazové informace s dříve získanými dovednostmi, jako je uchopení, přesun, položení nebo manipulace s předměty, a následně je seřadit do delšího postupu. Ve veřejně prezentovaných příkladech se objevuje příprava překapávané kávy, přesazování rostlin, sestavování sady a obracení palačinek. 135
Největší výzvou je takzvaný dlouhý horizont úkolu. Jednotlivý pohyb lze často naprogramovat nebo natrénovat samostatně. Desetiminutový úkol však může obsahovat desítky rozhodnutí, měnící se polohu předmětů a řadu příležitostí k chybě. S1 má udržet hlavní cíl po celou dobu a přizpůsobovat se scéně, místo aby přesně kopíroval pohyby člověka z videa.
Skild AI uvádí výrazný rozdíl mezi zadáním pomocí videa a zadáním pomocí jazyka. Při trénovací škále odpovídající 100 000 hodinám dat dosáhla video-promptovaná politika v testu dosud neznámých úkolů 66% průměrné úspěšnosti jednotlivých kroků, zatímco srovnatelný model typu vision-language-action řízený jazykovým pokynem dosáhl 9 %. 32
Výsledek naznačuje, že video může předat fyzické detaily, které slova popisují jen obtížně: který předmět uchopit, jak ho natočit, v jakém pořadí postupovat nebo jak reagovat na změny v prostředí.
Číslo je ale potřeba číst opatrně. Jde o výsledek zveřejněný společností Skild AI, nikoli o nezávisle zopakovaný průmyslový standard. Navíc 66% úspěšnost jednotlivých kroků neznamená, že robot s pravděpodobností 66 % dokončí celý desetiminutový úkol od začátku do konce.
Veřejné ukázky zahrnují například:
Tyto úkoly kombinují rozpoznávání předmětů, manipulaci, správné pořadí kroků a delší řízení pohybu. Nejde tedy jen o test jednoho izolovaného pohybu. Skild AI tvrdí, že úkoly nebyly součástí předtrénování, dostupné důkazy však pocházejí především od společnosti a z médií, která její výsledky shrnují. 133
Ukázky zároveň potvrzují zamýšlené rozhraní: člověk úkol jednou předvede a robot se pokusí postup zobecnit. Samy o sobě ale nedokazují, že S1 zvládne libovolnou domácí práci, obejde se bez dohledu nebo spolehlivě zvládne všechny fyzické odchylky ve výrobním provozu.
Hlavní slib S1 spočívá v tom, že po zhlédnutí demonstrace nepotřebuje samostatnou fázi dodatečného trénování. Skild AI a zprávy o uvedení modelu tento způsob popisují jako provádění v reálném čase, tedy přímo při použití modelu. 130
Ve zdrojích však není uvedeno spolehlivé přesné měření latence — například kolik sekund uplyne od konce videa do prvního pohybu robota. „Bez fine-tuningu“ znamená, že model neprochází novým cyklem úprav parametrů pro konkrétní úkol. Neznamená to automaticky okamžité zpracování každého videa ani absenci přípravy, kalibrace a bezpečnostních kontrol.
S1 je součástí širší strategie Skild Brain. Skild AI chce vytvořit jeden obecný model trénovaný na různých úkolech, typech robotů, simulacích a vizuálních datech od lidí, místo aby pro každý robot a každou práci vznikala samostatná politika. Společnost uvádí, že vytvořila simulovaný svět se 100 000 variantami robotů a testovala zobecnění na tělech, která nebyla součástí trénovacích dat. 6
Trénování na různých konstrukcích má modelu pomoci osvojit si obecné principy řízení. Materiály Skild AI popisují systém určený pro humanoidní roboty, čtyřnohé stroje, stolní robotická ramena i mobilní manipulátory. 310
Tvrzení, že Skild AI má 100- až 1 000krát více dat než konkurence, je však nutné brát s rezervou. Dodané zdroje nenabízejí standardizované a nezávisle ověřitelné srovnání velikosti, kvality ani praktické využitelnosti dat mezi jednotlivými firmami. Přesnější závěr je, že Skild AI sází na rozsáhlé trénování napříč různými robotickými těly a simulacemi, nikoli pouze na individuální ukázky pro jednu platformu.
Výraz omni-bodied, který Skild AI používá, označuje model navržený pro přenos mezi různými typy robotů. V principu by společný model mohl oddělit pochopení úkolu od přesné geometrie jednoho stroje a přizpůsobit se různým končetinám, kolům, manipulátorům i uspořádání pohonů. Skild AI uvádí, že její simulační testy zahrnovaly i dosud neviděné konstrukce řízené bez předchozího trénování na daném těle. 6
Hardware tím ale nepřestává být důležitý. Roboti se liší senzory, chapadly, limity kloubů, rozhraním řízení, latencí, nosností i bezpečnostními omezeními. Model, který se dokáže přenášet mezi různými konstrukcemi, může snížit náklady na adaptaci, nasazení však stále vyžaduje kompatibilní hardware, integraci a ověření v cílovém prostředí.
Podle veřejných zpráv běží software Skild AI na stovkách robotů v továrnách, datových centrech a logistických provozech. Zmiňována jsou nasazení v houstonské továrně NVIDIA, zkouška na letišti LaGuardia a spolupráce s firmami z oblasti kabeláže a stavebnictví. Společnost rovněž oznámila vztahy s ABB Robotics, Universal Robots a NVIDIA. 174
Tyto informace ukazují na komerční zájem a testování v reálném světě. Veřejně dostupné podklady ale nestačí k výpočtu výrobní míry dokončení, dostupnosti systému, úspor nebo návratnosti investic. Výsledek z laboratoře či kontrolovaného testu nelze automaticky vydávat za výrobní ukazatel. Jedna ze zpráv popisuje také plánované nasazení s Foxconnem na montážních linkách souvisejících se serverovými systémy NVIDIA Blackwell. To dokládá testovací nebo implementační záměr, nikoli důkaz plošného autonomního provozu továren. 43
Skild AI se díky financování zařadila mezi nejsledovanější firmy v oblasti fyzické umělé inteligence. Bloomberg uvedl, že společnost v lednu 2026 získala v investičním kole Series C vedeném SoftBank přibližně 1,4 miliardy dolarů při ocenění přes 14 miliard dolarů. 13 Předchozí kolo Series A oznámené v červenci 2024 mělo hodnotu 300 milionů dolarů a firmu ocenilo na 1,5 miliardy dolarů. 9
Přirovnání k „momentu ChatGPT“ popisuje očekávanou změnu v ovládání robotů: místo programování a opakovaného trénování pro každý nový úkol by pracovník jednoduše předvedl požadované chování a obecný model by ho převedl do akcí robota. S1 představuje výrazný krok tímto směrem.
Zatím ale nejde o důkaz, že univerzální roboti už dorazili. Nejsilnější veřejné výsledky pocházejí od samotné společnosti, soubor ukázkových úkolů je omezený a nezávisle ověřené průmyslové metriky nejsou v dodaných podkladech k dispozici. Střízlivější závěr proto zní: S1 ukazuje slibný způsob, jak omezit trénování robotů pro jednotlivé úkoly — použít video jako instrukci, čerpat z rozsáhlého předtrénování a ověřit, zda lze naučené dovednosti poskládat do nové, dlouhé posloupnosti akcí.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI tvrdí, že S1 dokáže po zhlédnutí jediného videa provádět dosud neznámé vícekrokové úkoly trvající až 10 minut, a to bez fine tuningu; v interním testu dosáhl 66% úspěšnosti jednotlivých kroků oproti 9 % u jaz...
Skild AI tvrdí, že S1 dokáže po zhlédnutí jediného videa provádět dosud neznámé vícekrokové úkoly trvající až 10 minut, a to bez fine tuningu; v interním testu dosáhl 66% úspěšnosti jednotlivých kroků oproti 9 % u jaz... Video slouží jako instrukce při samotném použití modelu. S1 kombinuje dříve naučené dovednosti, například uchopení, přenášení a manipulaci s předměty, do nové posloupnosti akcí.
Širší strategie Skild Brain staví na trénování napříč různými typy robotů a 100 000 simulovanými variantami.