Skild AI заявляє, що S1 може виконувати раніше небачені багатокрокові завдання тривалістю до 10 хвилин після перегляду одного відео людини — без fine tuning і окремого циклу донавчання. S1 сприймає відео як інструкцію під час виконання: модель визначає мету, використовує навички, отримані під час попереднього навчан...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI хоче зробити програмування роботів схожим на навчання через показ. Людина демонструє завдання на відео, а роботизована модель використовує цю демонстрацію як візуальну підказку — без запуску нового навчання під кожну окрему операцію. За описом компанії, S1 здатна виконувати раніше небачені багатокрокові завдання тривалістю до 10 хвилин, не змінюючи ваги моделі та без післяпереглядового донавчання. 1
Це важливо, адже традиційна робототехніка часто потребує спеціально зібраних даних, телеоперації, інженерного налаштування або повторного навчання, перш ніж машина зможе взятися за нову роботу. Обіцянка S1 полягає не в покадровому повторенні відео, а в тому, що модель розуміє мету демонстрації та комбінує вже набуті навички в нову послідовність дій.
S1 використовує візуальне навчання в контексті — visual in-context learning. Відео людини виступає інструкцією під час виконання завдання, а не новим набором даних для окремого тренування. Модель спостерігає за діями, визначає їхню мету й порядок, а потім перекладає побачене на команди для робота в його поточному середовищі. За описом Skild, ваги моделі для кожної нової демонстрації не оновлюються. 1
Такий підхід більше нагадує «покажи, як це робити», ніж класичне програмування робота. Система має пов’язати зорові спостереження з раніше вивченими вміннями — наприклад, схопити предмет, перемістити його, поставити на місце або виконати маніпуляцію — і правильно розташувати ці дії в довшій процедурі. Серед публічно продемонстрованих прикладів Skild називає приготування пуроверу, пересаджування рослини, складання набору та перевертання млинців. 135
Найскладніша частина тут — довгий горизонт виконання. Окремий короткий рух можна запрограмувати або навчити ізольовано. Натомість 10-хвилинне завдання може містити десятки рішень, зміну положення предметів і численні можливості для помилки. S1 має утримувати загальну мету протягом усієї послідовності та адаптувати рухи до сцени, а не просто відтворювати траєкторію людини.
Skild повідомляє про помітну різницю між відеопідказкою та мовною підказкою у тесті на незнайомих завданнях. За заявленого масштабу навчання у 100 000 годин політика з відеопідказкою досягла 66% середньої успішності на окремому кроці, тоді як зіставна vision-language-action-модель, якій давали мовні інструкції, показала 9%. 32
Результат натякає, що відео може передати фізичні деталі, які словами описати складніше: який саме предмет узяти, як його зорієнтувати, у якій послідовності діяти та як реагувати на зміни в середовищі.
Втім, ці цифри слід трактувати обережно. Це оцінка, про яку повідомила сама Skild, а не незалежно відтворений галузевий бенчмарк. Крім того, показник успішності окремих кроків не означає, що робот має 66-відсоткову гарантію виконати все 10-хвилинне завдання від початку до кінця.
До публічних демонстрацій належать:
Ці приклади поєднують розпізнавання предметів, маніпуляції, правильний порядок дій і тривале керування, а не перевіряють лише один ізольований рух. Skild описує їх як завдання, яких не було в попередньому навчанні, хоча доступні докази походять переважно від компанії та публікацій, що переказують її заяви. 133
Демонстрації показують задуманий інтерфейс: людина один раз виконує завдання, після чого робот намагається узагальнити процедуру. Але вони не доводять, що S1 уже може надійно виконувати будь-яку домашню роботу, працювати без нагляду або справлятися з усіма фізичними варіаціями виробничого середовища.
Заявлена перевага S1 полягає в тому, що після перегляду демонстрації робот може перейти до виконання без окремого етапу донавчання. Skild і матеріали про запуск називають такий режим виконанням у реальному часі в контексті. 130
Водночас у доступних джерелах немає надійного точного вимірювання затримки — наприклад, скільки секунд минає між завершенням відео та першим рухом робота. Формулювання «без fine-tuning» означає, що модель не проходить новий цикл оновлення ваг під конкретне завдання. Це не обов’язково означає миттєву обробку кожного відео або відсутність підготовки, калібрування та перевірок безпеки.
S1 є частиною ширшої стратегії Skild Brain — універсальної роботизованої моделі, яку навчають на різних завданнях, типах роботів, симуляціях і візуальних даних про дії людей. Ідея полягає в тому, щоб не створювати окрему політику для кожного робота й кожної роботи.
Skild заявляє, що створила симульований всесвіт зі 100 000 варіантів роботів і перевіряла узагальнення на формах, виключених із навчального набору. 6 У матеріалах компанії йдеться про роботу моделі з гуманоїдами, чотириногими роботами, настільними маніпуляторами та мобільними роботизованими платформами. 310
Твердження, що Skild має у 100–1 000 разів більше даних, ніж конкуренти, варто сприймати критично. Надані джерела не містять стандартизованого незалежного порівняння розміру, якості чи корисності роботизованого досвіду різних компаній. Більш обґрунтований висновок полягає в тому, що Skild робить ставку на масштабування через навчання на різних типах роботів і симуляцію, а не лише на спеціальні демонстрації для однієї апаратної платформи.
Термін omni-bodied — «універсальна для різних корпусів» — Skild використовує для опису моделі, яка має переносити знання між різними роботизованими платформами. У теорії спільна модель може відокремити розуміння завдання від точної геометрії конкретної машини й адаптуватися до різних кінцівок, коліс, маніпуляторів та схем приводів. Skild заявляє, що в симуляції тестувала роботів із формами, яких не було в навчальних даних, у режимі zero-shot — без попереднього навчання саме на цих конфігураціях. 6
Це не означає, що апаратне забезпечення стає неважливим. Роботи відрізняються сенсорами, захватами, обмеженнями суглобів, інтерфейсами керування, затримкою, вантажопідйомністю та вимогами безпеки. Узагальнення між різними корпусами може зменшити обсяг адаптації, але реальне впровадження все одно потребує сумісного обладнання, системної інтеграції та перевірки в конкретному середовищі.
За публічними повідомленнями, програмне забезпечення Skild працює на сотнях роботів у заводах, дата-центрах і логістичних об’єктах. Серед згаданих прикладів — завод NVIDIA у Х’юстоні, випробування в аеропорту Ла-Гуардія, а також робота з компаніями у сферах виробництва кабелів і будівництва. Компанія також оголосила про партнерства з ABB Robotics, Universal Robots і NVIDIA. 174
Ці повідомлення свідчать про інтерес бізнесу та випробування в реальних умовах, але не дають достатньо відкритих даних, щоб порахувати виробничу частку завершених завдань, безвідмовність, економію коштів або окупність інвестицій. Результат лабораторної чи контрольованої оцінки не можна автоматично вважати виробничим показником. Окремо повідомлялося про заплановане розгортання разом із Foxconn на складальних лініях, пов’язаних із виробництвом серверних систем NVIDIA Blackwell у Х’юстоні. Це свідчить про тестування або спробу впровадження, але не доводить масштабну автономну роботу заводу. 43
Фінансування Skild допомогло зробити її підхід одним із найпомітніших у сфері фізичного ШІ. Bloomberg повідомляв, що в січні 2026 року компанія залучила близько 1,4 млрд доларів у раунді Series C під проводом SoftBank, отримавши оцінку понад 14 млрд доларів. 13 Раніше, у липні 2024 року, Skild оголосила про залучення 300 млн доларів у раунді Series A за оцінки в 1,5 млрд доларів. 9
Порівняння із «моментом ChatGPT» описує очікувану зміну взаємодії з роботами: замість програмування або перенавчання машини для кожної операції працівник міг би показати бажану поведінку, а універсальна модель сама перетворила б її на команди.
S1 є помітним кроком до такого інтерфейсу, але ще не доказом того, що універсальні роботи вже стали реальністю. Найсильніші оприлюднені результати походять від самої компанії, набір завдань залишається обмеженим, а незалежно перевірених промислових показників у доступних матеріалах немає. Найобережніший висновок такий: S1 демонструє перспективний спосіб зменшити залежність роботів від спеціального навчання — використати відео як інструкцію, широке попереднє навчання як джерело багаторазово придатних навичок і перевірити, чи можна скласти їх у нове довготривале завдання.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Skild AI заявляє, що S1 може виконувати раніше небачені багатокрокові завдання тривалістю до 10 хвилин після перегляду одного відео людини — без fine tuning і окремого циклу донавчання.
Skild AI заявляє, що S1 може виконувати раніше небачені багатокрокові завдання тривалістю до 10 хвилин після перегляду одного відео людини — без fine tuning і окремого циклу донавчання. S1 сприймає відео як інструкцію під час виконання: модель визначає мету, використовує навички, отримані під час попереднього навчання, і складає їх у послідовність дій для поточного середовища.
Стратегія Skild Brain передбачає навчання на різних типах роботів і в симуляції, зокрема на 100 000 варіантах роботів.