LightNav 0 reúne en un modelo basado en Qwen3 VL 4B la navegación por instrucciones, la búsqueda de objetos y el seguimiento visual. Separa la intención espacial, que busca compartir entre robots, de las trayectorias concretas que necesita cada uno.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Preparar un robot para navegar suele exigir ejemplos de cómo moverse en una tarea y un entorno determinados. LightNav-0, de Light Origins, plantea otra vía: aprovechar un modelo de visión y lenguaje, Qwen3-VL-4B, y entrenar una política de navegación compartida con experiencia generada en simulación. El objetivo es depender menos de nuevas demostraciones obtenidas mediante teleoperación —cuando una persona guía al robot a distancia— para cada tarea y cada tipo de robot. 1
2
8
LightNav-0 reúne tres capacidades en un solo modelo: seguir instrucciones, dirigirse a objetos descritos con vocabulario abierto y seguir objetivos visuales. En lugar de añadir un componente de predicción independiente para cada tarea, utiliza una interfaz común basada en tokens, unidades con las que el modelo representa información y acciones. 1
5
Esa interfaz distingue dos niveles. Los tokens de señalamiento de doble canal expresan hacia dónde pretende ir el modelo de una forma concebida para servir en distintas tareas, escenas y configuraciones de robot. Después, un tokenizador de acciones con cuantización vectorial residual representa la trayectoria precisa que corresponde al robot concreto. El sistema también comprime el historial visual teniendo en cuenta el paso del tiempo, para incorporar observaciones de distintos momentos. 1
5
La distinción importa: compartir una intención espacial no implica que robots con cuerpos diferentes deban ejecutar exactamente los mismos movimientos. Es una estrategia para facilitar la transferencia, no una garantía de que cualquier robot nuevo funcione sin adaptación. 1
5
Light Origins llama Real2Sim2Real a su proceso de generación de datos. Según la empresa, convirtió más de 2.000 escenas reales obtenidas de internet en entornos simulados reutilizables y produjo más de 4.000 horas de experiencia de navegación que combina visión, lenguaje y acciones. Así puede crear situaciones variadas de entrenamiento sin depender exclusivamente de demostraciones teleoperadas recogidas por separado. Las cifras describen el proceso comunicado por la empresa; no cuantifican una reducción de costes de recopilación de datos en el mundo real. 8
El entrenamiento consta, según Light Origins, de tres etapas: entrenamiento intermedio de razonamiento corporizado, ajuste fino supervisado para el robot y aprendizaje por refuerzo en línea. Buscan adaptar el modelo preentrenado a la navegación, enseñarle el comportamiento mediante la interfaz compartida y mejorarlo a través de la interacción. 1
8
Light Origins afirma haber obtenido tasas de éxito monocular de primer nivel en 10 entornos públicos de simulación que incluyen seguimiento de instrucciones, navegación hacia objetos y seguimiento visual. También comunica transferencia sin entrenamiento adicional específico (zero-shot) entre configuraciones de robot y escenas reales. Son resultados presentados por el equipo: las fuentes citadas no establecen una tasa de éxito universal para robots desconocidos ni demuestran que la teleoperación pueda eliminarse. 7
8
13
La publicación incluye los pesos del modelo, el código, un informe técnico y materiales de evaluación de INSIGHT-Bench; se describe como una versión bajo licencia Apache 2.0. Esto permite a terceros examinar y poner a prueba el enfoque. Su propuesta práctica es más acotada que prescindir de la recogida de datos: reutilizar escenas simuladas y una política compartida podría reducir la necesidad de demostraciones para cada robot, mientras que el rendimiento real debe verificarse en cada máquina y entorno de uso. 2
5
10
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
LightNav 0 reúne en un modelo basado en Qwen3 VL 4B la navegación por instrucciones, la búsqueda de objetos y el seguimiento visual.
LightNav 0 reúne en un modelo basado en Qwen3 VL 4B la navegación por instrucciones, la búsqueda de objetos y el seguimiento visual. Separa la intención espacial, que busca compartir entre robots, de las trayectorias concretas que necesita cada uno.
Light Origins informa de más de 2.000 escenas convertidas en entornos simulados y más de 4.000 horas de experiencia de navegación; esas cifras no miden cuánto se ahorra en teleoperación.