Light Origins의 LightNav 0는 Qwen3 VL 4B를 바탕으로 지시 수행, 물체 찾기, 시각적 대상 추적을 하나의 모델에서 처리한다. 어디로 갈지 나타내는 토큰과 로봇별 이동 경로를 나타내는 토큰을 분리해, 서로 다른 로봇 사이에서 길찾기 능력을 이전하려 한다.
게시자GPT-6 Sol로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
로봇이 새 환경에서 길을 찾도록 가르칠 때마다 사람이 원격으로 조종한 시범 데이터를 다시 모아야 한다면, 로봇과 과제가 늘어날수록 준비 부담도 커진다. Light Origins의 LightNav-0는 이 부담을 줄이기 위해 만든 범용 길찾기 모델이다. 영상과 언어를 함께 처리하는 Qwen3-VL-4B를 기반으로, 지시를 따라 이동하고, 말로 설명한 물체를 찾아가고, 눈에 보이는 대상을 추적하는 일을 하나의 모델에 담았다. 1
2
8
LightNav-0는 과제마다 별도의 예측 모듈을 붙이는 대신 공통 토큰 체계를 사용한다. 두 채널로 구성된 포인팅 토큰은 모델이 향하려는 위치, 즉 공간적 의도를 표현한다. 이어 잔차 벡터 양자화 행동 토크나이저가 이를 각 로봇의 움직임에 맞는 구체적인 이동 경로로 나타낸다. 시간의 흐름을 반영해 이전 영상 관측을 압축하는 방식도 활용한다. 1
5
핵심은 목적지에 관한 판단을 공유하되 모든 로봇이 똑같이 움직인다고 가정하지 않는 데 있다. 다만 이런 설계가 처음 보는 로봇에서도 별도 조정 없이 반드시 작동한다는 뜻은 아니다. 1
5
Light Origins가 Real2Sim2Real이라고 부르는 데이터 구축 과정은 인터넷에서 수집한 현실 장면 2,000개 이상을 재사용 가능한 시뮬레이션 환경으로 바꾼다. 회사 측은 이를 통해 영상·언어·행동을 결합한 길찾기 학습 경험을 4,000시간 이상 생성했다고 밝혔다. 로봇마다 사람이 직접 조종해 시범을 모으는 방식에만 의존하지 않고, 시뮬레이션에서 다양한 상황을 만들겠다는 구상이다. 이 수치는 데이터 생성 규모이지 실제 데이터 수집 비용의 절감 폭을 측정한 결과는 아니다. 8
학습은 세 단계로 설명된다. 사전 학습된 모델을 길찾기에 맞추는 체화 추론 중간 학습, 공통 토큰을 활용한 행동을 익히는 체화 지도 미세조정, 상호작용을 통해 정책을 개선하는 온라인 강화학습이다. 1
8
Light Origins는 지시 수행, 물체를 목표로 한 이동, 시각적 추적을 아우르는 공개 길찾기 시뮬레이션 환경 10개에서 단안 카메라 기준 최고 수준의 성공률을 기록했다고 보고한다. 로봇의 형태와 현실 장면이 달라져도 추가 학습 없이 성능이 이어지는 ‘제로샷’ 일반화도 보고했다. 하지만 이는 연구팀이 제시한 평가 결과다. 낯선 모든 로봇에서 같은 성공률이 나온다거나 원격조작 시범을 완전히 없앨 수 있다는 증거로 받아들여서는 안 된다. 7
8
13
모델 가중치와 코드, 기술 보고서, INSIGHT-Bench 평가 자료가 공개됐으며, 공개물은 Apache 2.0 라이선스로 소개된다. 다른 연구자와 개발자가 접근법을 살펴보고 시험할 수 있다는 의미다. LightNav-0의 현실적인 목표는 데이터 수집을 없애는 것이 아니라, 재사용 가능한 시뮬레이션 환경과 공통 모델로 로봇별 시범 데이터의 필요량을 줄이는 것이다. 실제 성능은 적용할 로봇과 환경에서 따로 확인해야 한다. 2
5
10
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Light Origins의 LightNav 0는 Qwen3 VL 4B를 바탕으로 지시 수행, 물체 찾기, 시각적 대상 추적을 하나의 모델에서 처리한다.
Light Origins의 LightNav 0는 Qwen3 VL 4B를 바탕으로 지시 수행, 물체 찾기, 시각적 대상 추적을 하나의 모델에서 처리한다. 어디로 갈지 나타내는 토큰과 로봇별 이동 경로를 나타내는 토큰을 분리해, 서로 다른 로봇 사이에서 길찾기 능력을 이전하려 한다. [1][5]
회사 측은 현실 장면 2,000개 이상으로 만든 시뮬레이션에서 4,000시간 넘는 학습 경험을 생성했다고 밝힌다. 이는 원격조작 데이터 수집 비용이 실제로 줄었다는 측정 결과는 아니다.