Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения. Видео используется как визуальная инструкция во время выполнения: модель объединяет навыки, полученные на предварительном обу...
ОпубликовалОтредактировано с помощью GPT-5.6 LunaИзображения созданы с помощью GPT Image 1.5
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Робота обычно несложно научить одному движению — например, взять предмет или переместить его. Гораздо труднее заставить машину самостоятельно выполнить длинную последовательность действий, если задача заранее не была заложена в программу. Skild AI пытается решить именно эту проблему с помощью модели S1: человек показывает нужное действие на видео, а робот использует запись как инструкцию.
По заявлению компании, S1 умеет выполнять ранее не встречавшиеся многоэтапные задачи продолжительностью до 10 минут без отдельного дообучения после просмотра демонстрации. 1 Это не означает, что робот просто покадрово копирует движения человека. Модель должна понять цель, выбрать подходящие навыки и выстроить их в последовательность действий для конкретной сцены.
S1 использует подход, который Skild называет визуальным обучением в контексте — visual in-context learning. Видео с демонстрацией выступает не новым набором данных для тренировки, а подсказкой во время выполнения задачи. Модель анализирует происходящее, определяет цель и порядок действий, а затем преобразует эту информацию в команды роботу. Согласно описанию Skild, веса модели при этом не меняются: для каждой новой демонстрации не запускается отдельный цикл fine-tuning. 1
Иными словами, интерфейс напоминает обучение показом: человеку не нужно подробно описывать словами, какой предмет взять, как его повернуть и в какой момент перейти к следующему шагу. S1 пытается связать изображённую последовательность с уже освоенными навыками — захватом, перемещением, размещением предметов и манипуляциями — и собрать из них новую процедуру.
В числе публично показанных примеров Skild называет приготовление кофе методом pour-over, посадку растения в горшок, сборку набора и переворачивание блинов. 1
35
Главная сложность здесь — длинный горизонт планирования. Десятиминутная задача может включать десятки действий, меняющееся положение объектов и несколько точек, где робот способен ошибиться. S1 должна удерживать общую цель на протяжении всей последовательности и подстраиваться под окружающую обстановку, а не механически повторять траекторию человека.
Skild сравнила визуальное и языковое предъявление задачи на собственном тесте ранее не встречавшихся действий. При заявленном масштабе предварительного обучения в 100 000 часов видеоподсказанная политика показала 66% среднего успеха на отдельном шаге, тогда как сопоставимая vision-language-action-модель с инструкцией на естественном языке достигла 9%. 32
Разница указывает на преимущество видео в физических задачах: демонстрация сразу передаёт, какой именно объект нужно взять, как его ориентировать, в каком порядке выполнять действия и как реагировать на изменения в сцене. Словесное описание может оставить эти детали неоднозначными.
Но показатель требует осторожной трактовки. Это результат внутреннего тестирования, о котором сообщила сама Skild, а не независимо воспроизведённый отраслевой бенчмарк. Кроме того, 66% — это средний успех на уровне шагов, а не гарантия того, что робот с вероятностью 66% полностью завершит любую десятиминутную задачу от начала до конца.
В открытых демонстрациях S1 фигурируют:
Эти сценарии требуют не одного изолированного движения, а распознавания объектов, правильного порядка действий, управления захватом и продолжительного контроля. Skild описывает их как задачи, не входившие в предварительное обучение, однако доступные свидетельства в основном основаны на материалах компании и публикациях, пересказывающих её заявления. 1
33
Демонстрации показывают задуманный принцип: человек выполняет задачу один раз, после чего робот пытается обобщить процедуру. Они сами по себе не доказывают, что S1 способна надёжно выполнять любые бытовые поручения, работать без надзора или справляться со всеми физическими вариациями производственной среды.
Заявленное преимущество S1 состоит в отсутствии отдельного этапа обучения после просмотра. Skild и публикации о запуске описывают работу модели как выполнение в реальном времени: робот наблюдает демонстрацию и использует её как инструкцию на этапе вывода. 1
30
При этом в доступных источниках нет точного и надёжного замера задержки — например, количества секунд от окончания видео до первого движения робота. Формулировка «без fine-tuning» означает, что веса модели не проходят новый цикл обновления под конкретную задачу. Она не обязательно означает мгновенную обработку любого видео или отсутствие настройки, калибровки и проверок безопасности.
S1 — часть более широкой стратегии Skild Brain. Компания стремится обучать единую универсальную модель на множестве задач, типов роботов, симуляций и визуальных данных о действиях людей, вместо создания отдельной политики для каждого устройства и каждой операции.
Skild заявляет, что создала симулированную вселенную со 100 000 вариантами роботов и проверяла способность модели обобщать знания на тела, исключённые из обучающего набора. 6 В материалах компании также говорится о работе с гуманоидными роботами, четвероногими платформами, настольными манипуляторами и мобильными роботами-манипуляторами.
3
10
Такой подход должен помочь модели освоить общие принципы управления, не привязываясь к одному набору приводов и суставов. При этом часто повторяемое утверждение, будто у Skild в 100–1 000 раз больше данных, чем у конкурентов, следует воспринимать осторожно: предоставленные источники не содержат стандартизированного и независимо проверяемого сравнения объёма, качества и полезности данных разных компаний.
Более обоснованный вывод состоит в том, что Skild делает ставку на масштабирование за счёт симуляции и обучения на разных типах роботов, а не только на индивидуальных демонстрациях для одной аппаратной платформы.
Термин omni-bodied, или «универсальный для разных тел», — обозначение Skild для модели, которая должна переносить знания между различными роботами. В теории общий мозг может отделять понимание задачи от точной геометрии конкретной машины и адаптироваться к разным конечностям, колёсам, манипуляторам и схемам приводов. Skild утверждает, что в симуляции тестировала модель на формах роботов, которых не было в обучающих данных, в режиме zero-shot — без специального обучения на этих телах. 6
Это не делает аппаратную часть несущественной. Роботы по-прежнему различаются сенсорами, захватами, ограничениями суставов, задержками, грузоподъёмностью, интерфейсами управления и требованиями безопасности. Универсальная модель может уменьшить объём адаптации, но перед внедрением всё равно необходимы совместимое оборудование, интеграция и проверка в целевой среде.
По данным публичных публикаций, программное обеспечение Skild работает на сотнях роботов в фабриках, дата-центрах и логистических объектах. Среди упоминаемых примеров — фабрика NVIDIA в Хьюстоне, испытание в аэропорту Ла-Гуардия, а также проекты с компаниями из сфер производства кабельных систем и строительства. Компания также объявляла о сотрудничестве с ABB Robotics, Universal Robots и NVIDIA. 17
4
Эти сведения говорят о коммерческом интересе и реальных испытаниях, но не позволяют независимо рассчитать долю успешно завершённых производственных операций, время безотказной работы, экономию затрат или окупаемость. Результат лабораторного теста нельзя автоматически считать производственным показателем.
Отдельно сообщалось о планируемом внедрении Skild совместно с Foxconn на сборочных линиях, связанных с производством серверных систем NVIDIA Blackwell в Техасе. Это свидетельствует о проекте испытания или развертывания, но не доказывает наличие масштабного полностью автономного производства. 43
Инвесторы сделали Skild одной из наиболее заметных компаний в сфере физического ИИ. Bloomberg сообщал, что в январе 2026 года стартап привлёк около 1,4 млрд долларов в раунде Series C под руководством SoftBank; оценка компании превысила 14 млрд долларов. 13 Ранее, в июле 2024 года, Skild объявила о раунде Series A на 300 млн долларов при оценке в 1,5 млрд долларов.
9
Выражение «момент ChatGPT для роботов» описывает прежде всего возможное изменение пользовательского опыта. Вместо программирования или повторного обучения робота под каждую операцию сотрудник мог бы просто показать желаемое действие, а универсальная модель сама перевела бы демонстрацию в команды.
S1 действительно демонстрирует перспективный шаг к такому интерфейсу. Но это ещё не доказательство того, что универсальные роботы уже готовы выполнять любые бытовые или промышленные задачи без участия человека. Публичные результаты в основном представлены самой компанией, набор демонстраций ограничен, а независимые производственные метрики пока недоступны. Наиболее сдержанный вывод таков: S1 показывает способ сократить зависимость от специализированного обучения — использовать видео как инструкцию, а заранее полученные широкие навыки объединять в новую длинную последовательность действий.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения.
Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения. Видео используется как визуальная инструкция во время выполнения: модель объединяет навыки, полученные на предварительном обучении, и адаптирует их к текущей обстановке робота.
На внутреннем тесте незнакомых задач Skild сообщила о среднем успехе 66% на уровне отдельных шагов против 9% у сопоставимой модели, получавшей инструкции на естественном языке.
Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения. Видео используется как визуальная инструкция во время выполнения: модель объединяет навыки, полученные на предварительном обу...
ОпубликовалОтредактировано с помощью GPT-5.6 LunaИзображения созданы с помощью GPT Image 1.5
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Робота обычно несложно научить одному движению — например, взять предмет или переместить его. Гораздо труднее заставить машину самостоятельно выполнить длинную последовательность действий, если задача заранее не была заложена в программу. Skild AI пытается решить именно эту проблему с помощью модели S1: человек показывает нужное действие на видео, а робот использует запись как инструкцию.
По заявлению компании, S1 умеет выполнять ранее не встречавшиеся многоэтапные задачи продолжительностью до 10 минут без отдельного дообучения после просмотра демонстрации. 1 Это не означает, что робот просто покадрово копирует движения человека. Модель должна понять цель, выбрать подходящие навыки и выстроить их в последовательность действий для конкретной сцены.
S1 использует подход, который Skild называет визуальным обучением в контексте — visual in-context learning. Видео с демонстрацией выступает не новым набором данных для тренировки, а подсказкой во время выполнения задачи. Модель анализирует происходящее, определяет цель и порядок действий, а затем преобразует эту информацию в команды роботу. Согласно описанию Skild, веса модели при этом не меняются: для каждой новой демонстрации не запускается отдельный цикл fine-tuning. 1
Иными словами, интерфейс напоминает обучение показом: человеку не нужно подробно описывать словами, какой предмет взять, как его повернуть и в какой момент перейти к следующему шагу. S1 пытается связать изображённую последовательность с уже освоенными навыками — захватом, перемещением, размещением предметов и манипуляциями — и собрать из них новую процедуру.
В числе публично показанных примеров Skild называет приготовление кофе методом pour-over, посадку растения в горшок, сборку набора и переворачивание блинов. 1
35
Главная сложность здесь — длинный горизонт планирования. Десятиминутная задача может включать десятки действий, меняющееся положение объектов и несколько точек, где робот способен ошибиться. S1 должна удерживать общую цель на протяжении всей последовательности и подстраиваться под окружающую обстановку, а не механически повторять траекторию человека.
Skild сравнила визуальное и языковое предъявление задачи на собственном тесте ранее не встречавшихся действий. При заявленном масштабе предварительного обучения в 100 000 часов видеоподсказанная политика показала 66% среднего успеха на отдельном шаге, тогда как сопоставимая vision-language-action-модель с инструкцией на естественном языке достигла 9%. 32
Разница указывает на преимущество видео в физических задачах: демонстрация сразу передаёт, какой именно объект нужно взять, как его ориентировать, в каком порядке выполнять действия и как реагировать на изменения в сцене. Словесное описание может оставить эти детали неоднозначными.
Но показатель требует осторожной трактовки. Это результат внутреннего тестирования, о котором сообщила сама Skild, а не независимо воспроизведённый отраслевой бенчмарк. Кроме того, 66% — это средний успех на уровне шагов, а не гарантия того, что робот с вероятностью 66% полностью завершит любую десятиминутную задачу от начала до конца.
В открытых демонстрациях S1 фигурируют:
Эти сценарии требуют не одного изолированного движения, а распознавания объектов, правильного порядка действий, управления захватом и продолжительного контроля. Skild описывает их как задачи, не входившие в предварительное обучение, однако доступные свидетельства в основном основаны на материалах компании и публикациях, пересказывающих её заявления. 1
33
Демонстрации показывают задуманный принцип: человек выполняет задачу один раз, после чего робот пытается обобщить процедуру. Они сами по себе не доказывают, что S1 способна надёжно выполнять любые бытовые поручения, работать без надзора или справляться со всеми физическими вариациями производственной среды.
Заявленное преимущество S1 состоит в отсутствии отдельного этапа обучения после просмотра. Skild и публикации о запуске описывают работу модели как выполнение в реальном времени: робот наблюдает демонстрацию и использует её как инструкцию на этапе вывода. 1
30
При этом в доступных источниках нет точного и надёжного замера задержки — например, количества секунд от окончания видео до первого движения робота. Формулировка «без fine-tuning» означает, что веса модели не проходят новый цикл обновления под конкретную задачу. Она не обязательно означает мгновенную обработку любого видео или отсутствие настройки, калибровки и проверок безопасности.
S1 — часть более широкой стратегии Skild Brain. Компания стремится обучать единую универсальную модель на множестве задач, типов роботов, симуляций и визуальных данных о действиях людей, вместо создания отдельной политики для каждого устройства и каждой операции.
Skild заявляет, что создала симулированную вселенную со 100 000 вариантами роботов и проверяла способность модели обобщать знания на тела, исключённые из обучающего набора. 6 В материалах компании также говорится о работе с гуманоидными роботами, четвероногими платформами, настольными манипуляторами и мобильными роботами-манипуляторами.
3
10
Такой подход должен помочь модели освоить общие принципы управления, не привязываясь к одному набору приводов и суставов. При этом часто повторяемое утверждение, будто у Skild в 100–1 000 раз больше данных, чем у конкурентов, следует воспринимать осторожно: предоставленные источники не содержат стандартизированного и независимо проверяемого сравнения объёма, качества и полезности данных разных компаний.
Более обоснованный вывод состоит в том, что Skild делает ставку на масштабирование за счёт симуляции и обучения на разных типах роботов, а не только на индивидуальных демонстрациях для одной аппаратной платформы.
Термин omni-bodied, или «универсальный для разных тел», — обозначение Skild для модели, которая должна переносить знания между различными роботами. В теории общий мозг может отделять понимание задачи от точной геометрии конкретной машины и адаптироваться к разным конечностям, колёсам, манипуляторам и схемам приводов. Skild утверждает, что в симуляции тестировала модель на формах роботов, которых не было в обучающих данных, в режиме zero-shot — без специального обучения на этих телах. 6
Это не делает аппаратную часть несущественной. Роботы по-прежнему различаются сенсорами, захватами, ограничениями суставов, задержками, грузоподъёмностью, интерфейсами управления и требованиями безопасности. Универсальная модель может уменьшить объём адаптации, но перед внедрением всё равно необходимы совместимое оборудование, интеграция и проверка в целевой среде.
По данным публичных публикаций, программное обеспечение Skild работает на сотнях роботов в фабриках, дата-центрах и логистических объектах. Среди упоминаемых примеров — фабрика NVIDIA в Хьюстоне, испытание в аэропорту Ла-Гуардия, а также проекты с компаниями из сфер производства кабельных систем и строительства. Компания также объявляла о сотрудничестве с ABB Robotics, Universal Robots и NVIDIA. 17
4
Эти сведения говорят о коммерческом интересе и реальных испытаниях, но не позволяют независимо рассчитать долю успешно завершённых производственных операций, время безотказной работы, экономию затрат или окупаемость. Результат лабораторного теста нельзя автоматически считать производственным показателем.
Отдельно сообщалось о планируемом внедрении Skild совместно с Foxconn на сборочных линиях, связанных с производством серверных систем NVIDIA Blackwell в Техасе. Это свидетельствует о проекте испытания или развертывания, но не доказывает наличие масштабного полностью автономного производства. 43
Инвесторы сделали Skild одной из наиболее заметных компаний в сфере физического ИИ. Bloomberg сообщал, что в январе 2026 года стартап привлёк около 1,4 млрд долларов в раунде Series C под руководством SoftBank; оценка компании превысила 14 млрд долларов. 13 Ранее, в июле 2024 года, Skild объявила о раунде Series A на 300 млн долларов при оценке в 1,5 млрд долларов.
9
Выражение «момент ChatGPT для роботов» описывает прежде всего возможное изменение пользовательского опыта. Вместо программирования или повторного обучения робота под каждую операцию сотрудник мог бы просто показать желаемое действие, а универсальная модель сама перевела бы демонстрацию в команды.
S1 действительно демонстрирует перспективный шаг к такому интерфейсу. Но это ещё не доказательство того, что универсальные роботы уже готовы выполнять любые бытовые или промышленные задачи без участия человека. Публичные результаты в основном представлены самой компанией, набор демонстраций ограничен, а независимые производственные метрики пока недоступны. Наиболее сдержанный вывод таков: S1 показывает способ сократить зависимость от специализированного обучения — использовать видео как инструкцию, а заранее полученные широкие навыки объединять в новую длинную последовательность действий.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения.
Skild AI утверждает, что S1 способен выполнять ранее не встречавшиеся многоэтапные задачи длительностью до 10 минут после просмотра одного видео — без fine tuning и отдельного цикла обучения. Видео используется как визуальная инструкция во время выполнения: модель объединяет навыки, полученные на предварительном обучении, и адаптирует их к текущей обстановке робота.
На внутреннем тесте незнакомых задач Skild сообщила о среднем успехе 66% на уровне отдельных шагов против 9% у сопоставимой модели, получавшей инструкции на естественном языке.