LightNav 0 bygger på Qwen3 VL 4B och samlar instruktioner, objektsökning och visuell målföljning i en modell. Modellen skiljer mellan ett rumsligt mål som kan delas mellan robotar och rörelser som måste anpassas till robotens kropp.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Att träna en robot genom att fjärrstyra den och spela in lyckade körningar kan behöva upprepas för nya uppgifter och robottyper. Light Origins vill minska det behovet med LightNav-0: en öppen navigationsmodell byggd på bild- och språkmodellen Qwen3-VL-4B. Samma modell ska kunna följa instruktioner, hitta föremål utifrån fria beskrivningar och följa visuella mål. 1
2
8
LightNav-0 använder ett gemensamt gränssnitt av token, modellens interna byggstenar, i stället för en separat prediktionsdel för varje uppgift. Så kallade peknings-token i två kanaler uttrycker vart modellen vill ta sig. En residual vektorkvantiserad kodning av handlingar representerar sedan mer precisa rörelsebanor för den aktuella roboten. Modellen komprimerar också tidigare synintryck på ett sätt som tar hänsyn till tidsförloppet. 1
5
Skillnaden mellan mål och rörelse är viktig: robotar med olika kroppar kan dela en uppfattning om vart de ska, utan att behöva röra sig likadant. Det är en konstruktion avsedd att underlätta överföring mellan robotar, inte ett löfte om att varje ny robot fungerar utan anpassning. 1
5
Light Origins kallar sin dataprocess Real2Sim2Real. Enligt företaget har över 2 000 verkliga scener hämtade från internet omvandlats till återanvändbara simulerade miljöer. Därifrån har teamet skapat mer än 4 000 timmar navigeringserfarenhet med bilder, språk och handlingar. Tanken är att kunna variera träningen i simulering, i stället för att enbart samla in nya fjärrstyrda demonstrationer. Siffrorna beskriver den uppgivna träningsdatan – inte en uppmätt besparing i datainsamling. 8
Träningen beskrivs i tre steg: mellanträning för robotrelaterat resonemang, övervakad finjustering för navigationsbeteendet och därefter förstärkningsinlärning genom interaktion. 1
8
Light Origins uppger resultat i toppklass för navigering med en kamera i tio offentliga simuleringsmiljöer, för bland annat instruktionsföljning, navigering till föremål och visuell målföljning. Teamet rapporterar även zero-shot-överföring till andra robottyper och verkliga miljöer, alltså utan uppgiftsspecifik träning i det nya fallet. De rapporterade resultaten visar däremot inte att fjärrstyrd datainsamling kan avskaffas eller att en okänd robot alltid fungerar utan anpassning. 7
8
13
Modellvikter, kod, teknisk rapport och utvärderingsmaterial för INSIGHT-Bench har publicerats; utgåvan beskrivs som licensierad under Apache 2.0. Det gör metoden möjlig att granska och testa. Den praktiska frågan återstår för varje robot och miljö: hur väl fungerar modellen där, och hur mycket insamling av verkliga demonstrationer kan den faktiskt ersätta? 2
5
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
LightNav 0 bygger på Qwen3 VL 4B och samlar instruktioner, objektsökning och visuell målföljning i en modell.
LightNav 0 bygger på Qwen3 VL 4B och samlar instruktioner, objektsökning och visuell målföljning i en modell. Modellen skiljer mellan ett rumsligt mål som kan delas mellan robotar och rörelser som måste anpassas till robotens kropp.
Light Origins uppger att över 2 000 verkliga scener har gett mer än 4 000 timmars simulerad träning.