테슬라의 AI 책임자 아쇼크 엘루스와미는 옵티머스의 일부 시연을 두고 이례적으로 직설적인 설명을 내놨다. 그는 해당 로봇 동작이 “사실상 원격 조종(essentially remote controlled)”이며, 로봇은 “다소 맹목적으로” 지시받은 동작을 수행하면서 균형을 유지한다고 밝혔다. 또 물리적 로봇의 AI 안전 문제는 현재 대형 언어 모델(LLM)의 안전 문제를 “어린이 장난처럼 보이게 할” 수준이라고 평가했다.
16
핵심은 옵티머스에 온보드 지능이 전혀 없다는 뜻이 아니라는 점이다. 영상 속 유려한 수행만으로 로봇이 과업을 스스로 이해하고, 계획을 세우고, 낯선 상황을 헤쳐 나가며, 사람의 지시 없이 안전하게 완수했다는 결론을 내려서는 안 된다는 의미다.
사람이 움직임을 지시할 때 로봇이 맡는 일은 무엇인가
엘루스와미의 표현에 따르면 큰 동작은 원격 조종되지만, 로봇은 그 동작을 수행하는 동안 균형을 유지한다.
16 역할을 나누면, 사람은 행동 자체를 지시하거나 형성하고 로봇은 적어도 실시간 자세 안정화의 일부를 처리하는 구조로 해석할 수 있다.
이 역시 의미 있는 로보틱스 역량이다. 휴머노이드가 움직이는 동안 넘어지지 않게 하는 일은 쉽지 않다. 다만 이는 범용 자율성과는 다른, 더 좁은 범위의 주장이다. 이번 설명만으로 옵티머스가 낯선 장소를 안정적으로 인식하고, 적절한 작업 계획을 선택하며, 예상 밖의 접촉에 대응하고, 모든 오류에서 사람 개입 없이 안전하게 회복할 수 있다는 점이 입증된 것은 아니다.
따라서 로봇 시연을 볼 때는 어느 계층이 자율적이었는가를 물어야 한다. 로봇이 균형 유지나 저수준 운동 제어를 자체적으로 수행하더라도, 사람 원격 조작자가 상호작용이나 작업 단위의 행동을 맡고 있을 수 있다.
2024년과 2025년 시연은 어떻게 맞물리나
이번 발언은 2024년 10월 테슬라의 ‘위, 로봇(We, Robot)’ 행사 보도와도 맥이 닿는다. 테크크런치는 블룸버그·더 버지 등의 보도를 인용해, 옵티머스가 많은 상호작용에서 원격 조작됐다고 전했다. 다만 소식통들은 시제품이 AI를 이용해 외부 통제 없이 걸을 수 있었다고 설명했다.
28
이 구분은 중요하다. 관객과의 상호작용에 사람의 도움이 들어갔다고 해서 시연의 모든 요소가 가짜였다는 뜻은 아니다. 그러나 당시 행사가 완전히 자율적인 휴머노이드 호스트를 깔끔하게 증명한 것도 아니다.
2025년 12월 마이애미 시연에서는 물병을 나눠주던 옵티머스가 넘어지며 비슷한 의문이 제기됐다. 관찰자들은 로봇의 손동작이 원격 조작자가 VR 헤드셋을 벗는 동작을 닮았다고 지적했다. 다만 영상만으로 정확한 제어 방식을 확정할 수는 없다. 그럼에도 이 장면은 테슬라가 대중 시연에서 원격 조작, 사전 구성된 동작, 자율 동작을 명확히 구분해 공개할 필요성을 다시 부각했다.
20
물리 로봇의 안전이 LLM 안전과 다른 이유
엘루스와미의 비교는 텍스트 AI와 몸을 가진 AI의 근본적 차이에서 출발한다. 언어 모델이 실패하면 유해하거나 부정확한 내용을 생성할 수 있다. 반면 휴머노이드 로봇의 실패는 사람·물체·불안정한 환경 주변에서 즉각적인 물리적 움직임으로 이어질 수 있다.
16
걷고 물체를 잡는 기계의 안전은 무엇을 말할지, 어떤 목표를 택할지에 그치지 않는다. 예를 들어 로봇은 다음을 해내야 한다.
- 발판이나 접촉 상태가 바뀌어도 자세를 유지할 것
- 팔이나 몸을 움직일 때 가까운 사람을 피할 것
- 무게·형태·깨지기 쉬운 정도가 불확실한 물체를 적절한 힘으로 잡을 것
- 속도를 늦추거나 멈추거나 사람에게 제어를 넘겨야 할 시점을 판단할 것
이는 물리 로봇 AI가 불가능하다는 주장이 아니다. 인상적인 움직임만으로는 안전성을 충분히 판단할 수 없는 이유다. 신뢰성은 통제된 루틴뿐 아니라 드물고 복잡하며 계속 바뀌는 현실 조건에서도 유지돼야 한다.
테슬라가 풀어야 할 차원성과 지연시간 문제
테슬라는 카메라 픽셀, 차량 운동학 정보, 오디오, 지도, 내비게이션 입력을 받아 주행 제어 명령을 만드는 엔드투엔드 신경망 방식의 자율주행 접근법을 설명해 왔다. 엘루스와미는 고해상도·고프레임레이트·긴 맥락의 현실 입력을 다루는 규모를 ‘차원의 저주(curse of dimensionality)’로 규정했다.
14
자동차의 행동 공간은 조향·가속·제동처럼 비교적 제한적이다. 반면 휴머노이드는 훨씬 더 많은 관절 자유도와 신체 접촉, 조작 판단을 함께 관리해야 한다. 다리·몸통·팔·손을 조율하는 동시에 균형, 물체, 바로 옆 사람의 움직임을 고려해야 한다.
일론 머스크의 계정이 소개한 GTC 토론에서도 같은 요지가 나왔다. 휴머노이드는 자율주행차보다 더 많은 센서 양식과 자유도를 갖고, 최저 수준의 제어 신호 역시 실시간으로 생성돼야 한다는 것이다.
13
핵심 난제는 이 제어 루프다. 장면을 인식하거나 대략적인 목표를 정하는 것만으로는 부족하다. 넘어짐을 막고, 사람과의 접촉을 피하며, 잡는 힘을 조정하려면 인식부터 행동까지의 전체 과정이 충분히 빠르고 안전하게 반응해야 한다. 테슬라가 언급한 초당 36회(36Hz) FSD 판단 속도는 관련 경험이지만, 그 자체로 휴머노이드의 전신 제어와 물체 조작에 필요한 수준의 성능을 입증하지는 않는다.
12
FSD처럼 데이터 규모를 키워 자율성을 높이겠다는 전략
테슬라의 큰 전략은 자율주행과 로보틱스에 엔드투엔드 신경망 접근법을 적용하는 것이다. 엘루스와미의 작업을 다룬 보도는 FSD와 옵티머스 훈련을 연결하는 통합 ‘월드 시뮬레이터’를 소개했다.
2
이 전략에서는 옵티머스의 데이터 수집이 핵심이다. 프리몬트의 Gen 3 파일럿 생산은 현실 세계 데이터 수집에 초점을 맞춘 것으로 전해진다. 테슬라는 더 큰 전용 기가 텍사스 시설에서 2027년 대량 생산을 목표로 하고 있으며, 장기적으로는 연간 최대 1,000만 대 생산을 목표로 제시했다. 그러나 이는 목표치일 뿐, 확정된 생산 능력이나 대중 환경에서 사용할 수 있는 자율성의 증거는 아니다.
33
FSD와의 비유는 분명하다. 사람의 개입과 감독으로 시작해 운용 데이터를 모으고, 모델을 훈련한 뒤 시스템이 처리할 수 있는 범위를 넓혀 가겠다는 것이다. 다만 사람 주변에서 걷고 물체를 다루는 로봇은 자동차의 조향·가속·제동보다 접촉이 많은 훨씬 넓은 예외 상황을 마주한다.
입증된 것과 아직 입증되지 않은 것
테슬라는 옵티머스가 조화로운 동작을 수행할 수 있다는 점, 그리고 이를 개선하기 위한 소프트웨어·데이터·제조에 투자하고 있다는 점을 보여줬다. 하지만 각각의 시연에서 어느 동작이 어느 수준까지 자율적이었는지 명확히 판별할 수 있는 공개 내역을 제공하지는 않았다.
18
엘루스와미의 발언은 현재로서는 가장 명확한 해석을 제시한다. 눈길을 끄는 일부 동작은 사람의 지시를 받았고, 로봇의 온보드 균형 제어가 그 실행을 돕는다는 것이다.
16 테슬라의 엔드투엔드 접근법이 풀어야 할 미해결 검증은, 이 혼합형 구조에서 벗어나 비정형적인 인간 환경에서 놀람과 변수에 스스로 대응하며 안전하게 걷고, 잡고, 회복하는 로봇으로 나아갈 수 있느냐다.
그 능력이 투명한 방식으로, 반복적으로 입증되기 전까지 생산 목표와 인상적인 영상은 범용 휴머노이드 자율성이 이미 도착했다는 증거라기보다 그 방향으로의 개발 경로를 보여주는 자료로 보는 편이 타당하다.