LightNav 0 nutzt Qwen3 VL 4B als Grundlage für Anweisungen, die Suche nach beschriebenen Objekten und die Verfolgung visueller Ziele. Gemeinsame Tokens beschreiben das räumliche Ziel; weitere Tokens stehen für die Bewegungsabläufe des jeweiligen Roboters.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Für jeden neuen Roboter und jede Navigationsaufgabe eigene Fahrten per Fernsteuerung aufzuzeichnen, ist aufwendig. LightNav-0 ist der Versuch von Light Origins, diesen Bedarf zu verringern: Das auf dem Bild-Sprach-Modell Qwen3-VL-4B aufbauende System soll Anweisungen befolgen, frei beschriebene Objekte ansteuern und visuelle Ziele verfolgen – mit einer gemeinsamen Modellarchitektur statt einer eigenen Lösung für jede Aufgabe. 1
2
8
Der technische Kern ist eine gemeinsame Schnittstelle aus Tokens. Zweikanalige Pointing-Tokens beschreiben, wohin der Roboter gelangen soll. Ein residualer, vektorquantisierter Aktions-Tokenizer stellt dagegen die genaueren, auf den jeweiligen Roboter zugeschnittenen Bewegungsabläufe dar. Das Modell komprimiert außerdem frühere Bildbeobachtungen so, dass zeitliche Informationen nutzbar bleiben. Es benötigt keine separaten Vorhersagekomponenten für jede Navigationsaufgabe. 1
5
Die Trennung zwischen räumlichem Ziel und konkreter Bewegung soll Wissen zwischen verschiedenen Robotern übertragbar machen. Sie bedeutet aber nicht, dass jeder bisher unbekannte Roboter ohne Anpassung funktioniert. 1
5
Für seine Real2Sim2Real genannte Datenpipeline hat Light Origins nach eigenen Angaben mehr als 2.000 reale, aus dem Internet stammende Szenen in wiederverwendbare Simulationsumgebungen übertragen. Daraus seien über 4.000 Stunden Navigationserfahrung mit Bild-, Sprach- und Aktionsdaten entstanden. Das schafft zusätzliche Trainingssituationen, ohne für jede davon eine Fahrt fernzusteuern. Die Zahlen belegen jedoch keine gemessene Senkung der Kosten für die Datenerhebung. 8
Das Training beschreibt das Unternehmen in drei Stufen: eine Zwischenphase für roboterbezogenes Schlussfolgern (Embodied Reasoning), überwachtes Feintuning und schließlich Online-Reinforcement-Learning, bei dem das Modell durch Interaktion weiter verbessert wird. 1
8
Light Origins berichtet von führenden Erfolgsraten bei der Navigation mit einer einzelnen Kamera in zehn öffentlichen Simulationsumgebungen. Die Tests umfassen das Befolgen von Anweisungen, das Ansteuern von Objekten und die visuelle Zielverfolgung. Das Team meldet zudem Zero-Shot-Übertragung auf andere Robotertypen und reale Szenen – also Ergebnisse ohne vorheriges Training speziell für den jeweiligen Testfall. Diese berichteten Resultate belegen weder eine allgemeingültige Erfolgsquote für unbekannte Roboter noch, dass Fernsteuerungsdaten überflüssig werden. 7
8
13
Veröffentlicht wurden Modellgewichte, Code, ein technischer Bericht und Materialien für INSIGHT-Bench; die Veröffentlichung wird als unter Apache 2.0 lizenziert beschrieben. Damit können andere den Ansatz prüfen und testen. Die praktische Frage bleibt, wie gut ein konkreter Roboter in seiner tatsächlichen Umgebung zurechtkommt – und wie viele zusätzliche Demonstrationen er dafür noch braucht. 2
5
10
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
LightNav 0 nutzt Qwen3 VL 4B als Grundlage für Anweisungen, die Suche nach beschriebenen Objekten und die Verfolgung visueller Ziele.
LightNav 0 nutzt Qwen3 VL 4B als Grundlage für Anweisungen, die Suche nach beschriebenen Objekten und die Verfolgung visueller Ziele. Gemeinsame Tokens beschreiben das räumliche Ziel; weitere Tokens stehen für die Bewegungsabläufe des jeweiligen Roboters.
Light Origins meldet mehr als 2.000 rekonstruierte Szenen und über 4.000 Stunden simulierte Navigationserfahrung.