로봇에게 새로운 일을 시킬 때마다 수많은 시연 데이터와 별도 프로그래밍이 필요하다면, 범용 로봇의 활용성은 제한될 수밖에 없습니다. Skild AI의 S1은 이 과정을 ‘직접 보여주는 방식’으로 바꾸려는 로봇 파운데이션 모델입니다.
사람이 작업하는 모습을 영상으로 한 번 보여주면, S1은 이를 시각적 지시문으로 해석하고 현재 로봇과 주변 환경에 맞는 행동으로 바꿉니다. Skild AI는 S1이 사전 학습에서 보지 못한 다단계 조작 작업을 최대 10분 동안 수행하며, 새 작업마다 파인튜닝이나 관찰 후 추가 학습을 거치지 않는다고 설명합니다.
1
영상 한 편은 어떻게 ‘명령’이 되나
S1의 핵심은 **시각적 인컨텍스트 학습(visual in-context learning)**입니다. 일반적인 로봇 학습처럼 새 작업에 맞춰 모델 가중치를 업데이트하는 것이 아니라, 사람의 시연 영상을 추론 단계에서 하나의 프롬프트로 사용합니다. 모델은 영상에서 목표와 작업 순서를 추론한 뒤, 사전 학습해 둔 기술을 현재 장면의 물체와 로봇 상태에 맞춰 실행합니다.
1
예를 들어 사람의 시연에는 물체를 어디서 집는지, 어떤 방향으로 돌리는지, 어떤 순서로 다음 행동으로 넘어가는지 같은 물리적 정보가 담겨 있습니다. S1은 이를 단순히 영상의 움직임 그대로 재생하는 것이 아니라, 잡기·옮기기·놓기·조작하기 등의 기술을 더 긴 절차로 구성하는 것을 목표로 합니다.
Skild AI가 공개한 예시는 드립 커피 만들기, 화분에 식물 심기, 키트 조립, 팬케이크 뒤집기 등입니다.
1
35 한 번의 동작이 아니라 물체 인식, 순서 판단, 지속적인 제어가 필요한 작업이라는 점이 특징입니다.
가장 어려운 부분은 **긴 시간에 걸친 작업(long horizon)**입니다. 몇 초짜리 동작과 달리 10분짜리 작업에는 수십 개의 판단이 들어갈 수 있고, 작업 도중 물체 위치가 바뀌거나 작은 실수가 발생할 수도 있습니다. S1은 시연자의 궤적을 기계적으로 복사하기보다 작업의 목표를 유지하면서 변화한 환경에 맞춰 행동하는 것을 지향합니다.
언어로 설명하는 로봇보다 영상이 효과적인가
Skild AI는 미지 작업 평가에서 영상 프롬프트 방식과 언어 프롬프트 방식의 차이를 비교했습니다. 회사가 제시한 동일한 10만 시간 규모의 학습 조건에서, 영상으로 지시받은 정책은 **평균 단계별 성공률 66%**를 기록했고 언어 기반 비전·언어·행동(VLA) 정책은 **9%**를 기록했습니다.
32
이 결과가 맞다면 영상은 언어만으로 전달하기 어려운 물리적 세부 정보를 더 풍부하게 제공할 수 있습니다. 어떤 물체를 집어야 하는지, 손잡이나 도구를 어느 방향으로 잡아야 하는지, 행동의 순서는 무엇인지 등을 직접 보여줄 수 있기 때문입니다.
다만 수치를 해석할 때는 주의가 필요합니다. 이 결과는 Skild AI가 보고한 내부 평가이며, 독립적으로 반복 검증된 업계 표준 벤치마크로 제시된 것은 아닙니다. 또한 ‘단계별 성공률 66%’는 10분짜리 전체 작업을 처음부터 끝까지 66%의 확률로 완수한다는 뜻이 아닙니다. 작업 전체의 완료율과 각 단계의 성공률은 서로 다른 지표입니다.
어떤 작업을 시연했나
공개된 S1 시연에는 다음과 같은 조작 작업이 포함됩니다.
- 드립 커피 준비
- 화분에 식물 심기
- 키트 조립
- 팬케이크 뒤집기
이 작업들은 단일 동작이 아니라 물체를 파악하고, 여러 행동을 올바른 순서로 수행하며, 일정 시간 동안 제어를 유지해야 합니다. Skild AI는 이 작업들이 사전 학습에서 보지 못한 것이라고 설명하지만, 현재 공개된 근거는 주로 회사 발표와 이를 인용한 보도에 기반합니다.
1
33
따라서 이 시연만으로 S1이 임의의 가사 노동을 안정적으로 수행한다거나, 사람의 감독 없이 모든 환경에서 작동한다고 결론 내리기는 어렵습니다. 실제 공장에서는 물체의 모양과 위치, 조명, 센서, 안전 규정, 로봇의 하드웨어가 달라질 수 있기 때문입니다.
관찰 후 얼마나 빨리 움직이나
S1의 광고상 장점은 영상을 본 뒤 별도의 작업별 학습 사이클을 거치지 않고 실행을 시작할 수 있다는 점입니다. Skild AI와 관련 보도는 이를 실시간 인컨텍스트 실행으로 설명합니다.
1
30
그러나 공개 자료에는 영상이 끝난 뒤 첫 동작을 시작하기까지 몇 초가 걸리는지와 같은 정밀한 지연 시간 측정값이 없습니다. ‘파인튜닝이 없다’는 말은 새 작업에 맞춰 모델 가중치를 업데이트하지 않는다는 뜻이지, 모든 영상이 즉시 처리되거나 로봇에 별도의 설치·보정·안전 점검이 필요 없다는 뜻은 아닙니다.
10만 개 로봇을 시뮬레이션하는 ‘옴니바디’ 전략
S1은 Skild AI가 더 넓게 추진하는 Skild Brain 전략의 일부입니다. 회사는 로봇 한 종류와 작업 한 가지마다 별도 정책을 만드는 대신, 여러 작업·로봇 형태·시뮬레이션·사람의 시각 데이터를 함께 학습하는 범용 모델을 구축하려고 합니다. Skild AI는 10만 가지 로봇 변형으로 구성된 시뮬레이션 세계를 만들고, 학습에서 제외한 로봇 형태에도 일반화되는지 시험했다고 밝혔습니다.
6
이런 접근은 휴머노이드, 사족보행 로봇, 탁상형 로봇 팔, 이동형 매니퓰레이터처럼 서로 다른 몸체에서 공통적인 제어 원리를 학습하려는 시도입니다.
3
10
일부 자료에서 Skild AI가 경쟁사보다 100~1,000배 많은 데이터를 보유했다는 주장이 반복되지만, 제공된 자료만으로는 기업별 데이터의 양과 품질, 실제 로봇 경험을 동일한 기준으로 비교한 독립 감사 결과를 확인할 수 없습니다. 더 신중하게 말하면 Skild AI는 특정 하드웨어에 맞춘 맞춤형 시연 데이터만 늘리기보다, 여러 로봇 형태와 시뮬레이션을 결합해 규모를 키우는 전략을 취하고 있습니다.
‘옴니바디’가 해결하지 못하는 것
Skild AI가 말하는 ‘옴니바디(omni-bodied)’는 하나의 모델이 서로 다른 로봇 몸체로 전이되도록 설계됐다는 뜻입니다. 이론적으로는 작업의 목표와 시각적 이해를 특정 기계의 관절 배치나 구동기 구조와 어느 정도 분리해, 다리·바퀴·팔·그리퍼가 다른 로봇에도 적응할 수 있습니다. Skild AI는 학습에서 제외한 로봇 형태를 제로샷으로 제어하는 시뮬레이션 결과를 제시했습니다.
6
그렇다고 하드웨어 차이가 사라지는 것은 아닙니다. 실제 로봇은 센서, 그리퍼, 관절의 가동 범위, 제어 인터페이스, 지연 시간, 적재 중량, 안전 제약이 모두 다릅니다. 범용 모델이 로봇별 적응 작업을 줄일 수는 있어도, 목표 환경에 맞춘 시스템 통합과 검증은 여전히 필요합니다.
산업 현장 배치와 실제 성과는 어디까지 공개됐나
공개 보도에 따르면 Skild AI의 소프트웨어는 공장, 데이터센터, 물류 환경의 수백 대 로봇에서 작동하고 있습니다. 사례로는 엔비디아의 휴스턴 공장, 라과디아 시험 운영, 배선 및 건설 업체와의 작업이 언급됐습니다. Skild AI는 ABB 로보틱스, 유니버설 로봇, 엔비디아와의 협력도 발표했습니다.
17
4
또 다른 보도는 폭스콘과 함께 엔비디아 블랙웰 GPU 서버 시스템을 조립하는 휴스턴 생산라인에 모델을 배치할 계획을 전했습니다. 이는 시험 또는 배치 추진의 근거이지, 광범위한 무인 공장 운영이 이미 입증됐다는 의미는 아닙니다.
43
현재 공개된 정보만으로는 이러한 산업 현장의 생산 완료율, 가동률, 비용 절감액, 투자수익률을 독립적으로 계산하기 어렵습니다. 연구실이나 통제된 환경에서 나온 66% 수치를 실제 생산라인의 성과로 간주해서도 안 됩니다.
14억 달러 투자와 ‘로봇의 챗GPT 순간’
Skild AI는 물리적 AI 분야에서 큰 규모의 투자를 유치하며 주목받고 있습니다. 블룸버그는 소프트뱅크가 주도한 2026년 1월 시리즈 C에서 Skild AI가 약 14억 달러를 조달했고, 기업가치가 140억 달러 이상으로 평가됐다고 보도했습니다.
13 회사가 2024년 7월 발표한 초기 시리즈 A 규모는 3억 달러, 당시 기업가치는 15억 달러였습니다.
9
‘물리적 AI의 챗GPT 순간’이라는 표현은 로봇 사용법이 바뀔 수 있다는 기대를 담고 있습니다. 작업마다 로봇을 새로 프로그래밍하거나 재훈련하는 대신, 작업자가 원하는 행동을 한 번 보여주면 범용 모델이 이를 로봇의 동작으로 번역한다는 구상입니다. S1은 이 인터페이스에 가까이 다가간 사례로 볼 수 있습니다.
다만 S1이 범용 로봇 시대의 도래를 입증한 것은 아닙니다. 핵심 성과는 회사가 보고한 결과이고, 공개된 작업 종류는 제한적이며, 산업 현장의 독립적으로 검증된 지표도 충분하지 않습니다. 현재 가장 타당한 평가는 이렇습니다. S1은 영상을 지시문으로 활용하고, 대규모 사전 학습에서 얻은 기술을 새롭고 긴 작업에 조합함으로써 작업별 로봇 훈련을 줄일 가능성을 보여줬습니다. 이제 남은 과제는 이 가능성이 다양한 하드웨어와 실제 생산 환경에서도 반복적으로 재현되는지 확인하는 일입니다.