LightNav 0, oparty na Qwen3 VL 4B, łączy wykonywanie instrukcji, wyszukiwanie opisanych obiektów i śledzenie celów wizualnych w jednym modelu. Model oddziela ogólny zamiar ruchu od trajektorii właściwej dla danego robota.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Aby nauczyć robota nawigacji, często zbiera się demonstracje, podczas których człowiek steruje nim zdalnie. Light Origins proponuje inne podejście: jeden model dla kilku rodzajów zadań i różnych robotów, trenowany w dużej mierze na doświadczeniu z symulacji. LightNav-0 bazuje na modelu analizującym obraz i język Qwen3-VL-4B. Ma wykonywać polecenia, docierać do obiektów określonych swobodnym opisem oraz śledzić wskazane cele wizualne. 1
2
8
LightNav-0 nie używa osobnego mechanizmu przewidywania dla każdego z tych zadań. Korzysta ze wspólnego interfejsu tokenów — elementów, za pomocą których model zapisuje decyzje nawigacyjne. Dwukanałowe tokeny wskazujące opisują zamiar przestrzenny, czyli dokąd należy się skierować. Następnie tokenizator działań z resztkową kwantyzacją wektorową przedstawia dokładniejszą trajektorię, uwzględniającą sposób poruszania się konkretnego robota. Model wykorzystuje też skompresowaną historię obserwacji obrazu, aby uwzględniać to, co widział wcześniej. 1
5
To rozróżnienie jest istotą pomysłu na transfer: różne roboty mogą korzystać ze wspólnej reprezentacji celu, choć nie muszą wykonywać identycznych ruchów. Sama konstrukcja modelu nie gwarantuje jednak, że wcześniej niewidziany robot zadziała bez dostosowania. 1
5
Firma nazywa swój proces Real2Sim2Real. Według Light Origins ponad 2 000 rzeczywistych scen pozyskanych z internetu przekształcono w środowiska symulacyjne, w których wygenerowano ponad 4 000 godzin doświadczenia nawigacyjnego łączącego obraz, język i działania. Dzięki temu sceny można wykorzystywać ponownie i tworzyć różne sytuacje treningowe bez zbierania osobnej serii demonstracji przez zdalne sterowanie dla każdego zadania. Podane liczby opisują skalę procesu deklarowaną przez firmę, a nie zmierzoną redukcję kosztów pracy z rzeczywistymi robotami. 8
Trening obejmuje trzy etapy: pośrednie uczenie rozumowania związanego z działaniem robota, nadzorowane dostrajanie zachowań oraz uczenie ze wzmocnieniem podczas interakcji. Ich celem jest przystosowanie bazowego modelu obrazu i języka do nawigacji, nauczenie go korzystania ze wspólnego interfejsu i dalsze doskonalenie decyzji. 1
8
Light Origins podaje, że LightNav-0 osiągnął czołowe wskaźniki powodzenia przy nawigacji opartej na obrazie z jednej kamery w 10 publicznych ustawieniach symulacyjnych. Obejmują one wykonywanie instrukcji, docieranie do obiektu oraz śledzenie celu. Zespół informuje również o transferze zero-shot — działaniu bez dodatkowego treningu na danym przypadku — między różnymi typami robotów i scenami rzeczywistymi. Są to wyniki raportowane przez twórców, nie dowód na niezawodne działanie z każdym nowym robotem ani na możliwość całkowitego porzucenia demonstracji zbieranych przez zdalne sterowanie. 7
8
13
Udostępniono wagi modelu, kod, raport techniczny i materiały ewaluacyjne INSIGHT-Bench; publikacja jest opisywana jako objęta licencją Apache 2.0. Pozwala to innym sprawdzić i testować rozwiązanie. Najważniejsza obietnica LightNav-0 pozostaje konkretna: wspólny model i symulacje mogą ograniczyć potrzebę zbierania danych osobno dla każdego robota. Skuteczność w danym środowisku nadal wymaga weryfikacji. 2
5
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
LightNav 0, oparty na Qwen3 VL 4B, łączy wykonywanie instrukcji, wyszukiwanie opisanych obiektów i śledzenie celów wizualnych w jednym modelu.
LightNav 0, oparty na Qwen3 VL 4B, łączy wykonywanie instrukcji, wyszukiwanie opisanych obiektów i śledzenie celów wizualnych w jednym modelu. Model oddziela ogólny zamiar ruchu od trajektorii właściwej dla danego robota. Ma to ułatwiać przenoszenie wyuczonych umiejętności między konstrukcjami.
Light Origins podaje, że wykorzystało ponad 2 000 scen i wygenerowało ponad 4 000 godzin doświadczenia w symulacji.