Fondé sur Qwen3 VL 4B, LightNav 0 réunit dans un même modèle le suivi d’instructions, la recherche d’objets et le suivi visuel. Light Origins dit avoir créé plus de 4 000 heures d’expérience simulée à partir de plus de 2 000 scènes réelles trouvées sur Internet.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Faire naviguer un robot demande souvent de lui montrer quoi faire, en le pilotant à distance. Recommencer pour chaque tâche et chaque type de robot peut rendre la collecte de données lourde. LightNav-0, le modèle de Light Origins fondé sur Qwen3-VL-4B, cherche à réduire cette dépendance : il rassemble dans un même système le suivi d’instructions, la navigation vers des objets désignés librement et le suivi d’une cible visuelle. 1
2
8
LightNav-0 n’ajoute pas de module de prédiction distinct pour chaque tâche. Il utilise une interface commune fondée sur des tokens, des unités que le modèle peut traiter et produire. Des tokens de pointage à deux canaux expriment l’endroit où il veut aller, sous une forme conçue pour être partagée entre tâches, scènes et types de robots. Un tokeniseur d’actions à quantification vectorielle résiduelle représente ensuite la trajectoire plus précise, propre aux mouvements du robot concerné. Le modèle compresse aussi l’historique visuel en tenant compte du temps, afin d’exploiter plusieurs observations successives. 1
5
Cette distinction entre « où aller » et « comment y aller » est au cœur de l’objectif de transfert. Elle ne signifie toutefois pas qu’un robot jamais testé pourra utiliser le modèle sans adaptation. 1
5
Light Origins appelle sa méthode de production de données Real2Sim2Real. L’entreprise affirme avoir transformé plus de 2 000 scènes réelles trouvées sur Internet en environnements simulés réutilisables, produisant plus de 4 000 heures d’expérience de navigation associant vision, langage et action. L’idée est de varier les situations d’entraînement sans devoir collecter uniquement des démonstrations téléopérées pour chaque cas. Ces volumes décrivent le processus annoncé par l’entreprise : ils ne chiffrent pas une économie effectivement réalisée sur la collecte de données réelles. 8
L’entraînement comporte trois étapes annoncées : une phase intermédiaire de raisonnement appliqué à la navigation, un affinage supervisé, puis un apprentissage par renforcement en ligne. Elles visent respectivement à adapter le modèle vision-langage à la navigation, à lui enseigner le comportement représenté par les tokens et à améliorer sa conduite par interaction. 1
8
Light Origins revendique des taux de réussite de premier plan avec une seule caméra dans dix configurations publiques de simulation, couvrant le suivi d’instructions, la recherche d’objets et le suivi visuel. L’équipe rapporte aussi une généralisation zero-shot — sans entraînement spécifique préalable — entre différents types de robots et scènes réelles. Il s’agit de ses évaluations annoncées, pas d’une preuve que la téléopération devient inutile ni d’une garantie pour tout robot inconnu. 7
8
13
Les poids du modèle, le code, un rapport technique et les ressources d’évaluation INSIGHT-Bench ont été publiés ; la diffusion est présentée comme relevant de la licence Apache 2.0. D’autres équipes peuvent ainsi examiner et tester l’approche. La promesse pratique reste mesurée : des scènes simulées réutilisables et un modèle partagé pourraient réduire les démonstrations nécessaires robot par robot, mais les performances doivent encore être vérifiées dans chaque contexte d’utilisation. 2
5
10
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Fondé sur Qwen3 VL 4B, LightNav 0 réunit dans un même modèle le suivi d’instructions, la recherche d’objets et le suivi visuel.
Fondé sur Qwen3 VL 4B, LightNav 0 réunit dans un même modèle le suivi d’instructions, la recherche d’objets et le suivi visuel. Light Origins dit avoir créé plus de 4 000 heures d’expérience simulée à partir de plus de 2 000 scènes réelles trouvées sur Internet.
Les résultats annoncés sur dix configurations de simulation et le transfert entre types de robots sont encourageants, mais ne garantissent pas le fonctionnement sur tout nouveau robot.