LightNav 0 побудована на Qwen3 VL 4B і об’єднує виконання навігаційних інструкцій, пошук описаних об’єктів та візуальне стеження в одній моделі. Модель відокремлює просторовий намір від траєкторії руху, що залежить від конкретного робота.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Щоб навчити робота орієнтуватися, розробники можуть записувати демонстрації, дистанційно керуючи ним. Для нового завдання чи іншої конструкції робота такий процес може вимагати окремих даних. LightNav-0 — спроба Light Origins зменшити цю залежність: модель на основі Qwen3-VL-4B має виконувати навігаційні інструкції, знаходити об’єкти за довільним словесним описом і стежити за візуальною ціллю через спільний інтерфейс, без окремого механізму прогнозування для кожного завдання. 1
2
8
LightNav-0 розділяє намір і його виконання. Двоканальні токени вказування описують, куди модель прагне спрямувати робота, у формі, задуманої як спільна для різних завдань, сцен і конструкцій. Інший компонент — токенізатор дій із залишковим векторним квантуванням — представляє точнішу траєкторію з урахуванням конкретного робота. Стиснення історії візуальних спостережень допомагає моделі враховувати не лише поточний кадр. 1
5
Це пояснює ідею перенесення навичок між роботами: просторовий намір можна описувати спільною мовою, не припускаючи, що всі машини рухаються однаково. Але сама архітектура не гарантує, що незнайомий робот працюватиме без додаткового налаштування. 1
5
Підхід Real2Sim2Real використовує реальні сцени як основу для симуляцій. Light Origins повідомляє, що перетворила понад 2 000 сцен із відкритих інтернет-джерел на придатні для повторного використання змодельовані середовища й отримала понад 4 000 годин досвіду навігації, що поєднує зорові дані, мову та дії. Так команда може створювати різноманітні навчальні ситуації, не покладаючись лише на нові демонстрації з дистанційним керуванням. Наведені обсяги описують навчальний конвеєр, а не доведену економію часу чи коштів у реальному світі. 8
Компанія називає три етапи підготовки моделі: проміжне навчання втіленого міркування, контрольоване донавчання на завданнях робота та онлайн-навчання з підкріпленням. Їхнє призначення — пристосувати попередньо навчену модель зору й мови до навігації, сформувати поведінку через спільний інтерфейс токенів і вдосконалити її під час взаємодії. 1
8
Light Origins заявляє про найкращі показники успішності за даними однієї камери в 10 публічних симуляційних умовах: для виконання інструкцій, руху до заданого об’єкта та візуального стеження. Команда також повідомляє про перенесення навичок на інші типи роботів і реальні сцени без додаткового навчання. Це результати, представлені розробниками, а не доказ універсальної роботи на будь-якому новому роботі чи можливості повністю відмовитися від дистанційно записаних демонстрацій. 7
8
13
Опубліковано ваги моделі, код, технічний звіт і матеріали для оцінювання INSIGHT-Bench; реліз описано як доступний за ліцензією Apache 2.0. Це дає змогу іншим дослідникам вивчати й випробовувати підхід. Практичний висновок поки стриманіший за обіцянку повної автономності: спільна модель і повторно використовувані симуляції можуть скоротити потребу в даних для кожного окремого робота, але роботу в конкретному реальному середовищі все одно потрібно перевіряти. 2
5
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
LightNav 0 побудована на Qwen3 VL 4B і об’єднує виконання навігаційних інструкцій, пошук описаних об’єктів та візуальне стеження в одній моделі.
LightNav 0 побудована на Qwen3 VL 4B і об’єднує виконання навігаційних інструкцій, пошук описаних об’єктів та візуальне стеження в одній моделі. Модель відокремлює просторовий намір від траєкторії руху, що залежить від конкретного робота.
За даними Light Origins, понад 2 000 сцен стали основою для більш ніж 4 000 годин досвіду навігації в симуляції.