LightNav 0 построена на Qwen3 VL 4B и объединяет выполнение инструкций, поиск объектов по описанию и визуальное отслеживание в одной модели. По данным Light Origins, более 2000 реальных сцен стали основой для свыше 4000 часов навигационного опыта в симуляции.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Чтобы обучить робота ориентироваться в пространстве, ему нередко показывают нужные действия, управляя им дистанционно. Light Origins предлагает иной способ уменьшить объём такой работы: обучать одну навигационную модель на множестве смоделированных ситуаций, а затем переносить её на разные задачи и типы роботов. LightNav-0 построена на модели Qwen3-VL-4B, работающей с изображениями и текстом. Она предназначена для выполнения навигационных инструкций, поиска объектов по произвольному описанию и визуального отслеживания цели. 1
2
8
В LightNav-0 эти задачи используют единый интерфейс на основе токенов, без отдельного выходного блока для каждой из них. Двухканальные указательные токены задают пространственное намерение модели — условно, куда следует двигаться. Токенизатор действий с остаточным векторным квантованием представляет более точную траекторию с учётом особенностей конкретного робота. Модель также сжимает историю визуальных наблюдений так, чтобы учитывать происходившее в разные моменты времени. 1
5
Смысл разделения в том, чтобы переносить между роботами представление о цели движения, не предполагая, что все они передвигаются одинаково. Однако такая архитектура сама по себе не гарантирует, что ранее не встречавшемуся роботу не понадобится адаптация. 1
5
Свой конвейер подготовки данных Light Origins называет Real2Sim2Real. По данным компании, более 2000 реальных сцен, взятых из интернета, были преобразованы в многократно используемые виртуальные среды. На их основе получено свыше 4000 часов навигационного опыта, объединяющего зрительные данные, язык и действия. Это позволяет создавать разнообразные учебные ситуации в симуляции, а не полагаться только на новые демонстрации с дистанционным управлением для каждого робота и каждой задачи. Сами по себе эти цифры не показывают, насколько снизились затраты на сбор данных в реальном мире. 8
Обучение, согласно описанию компании, проходит в три этапа: промежуточное обучение рассуждению для задач робототехники, дообучение на размеченных примерах и обучение с подкреплением при взаимодействии со средой. Эти этапы должны приспособить исходную модель к навигации и улучшить её действия. 1
8
Light Origins заявляет о лучших результатах по доле успешных попыток при использовании одной камеры в 10 общедоступных условиях симуляционного тестирования. Они охватывают следование инструкциям, поиск заданного объекта и визуальное отслеживание. Команда также сообщает о переносе навыков на другие типы роботов и реальные сцены без дополнительного обучения на них. Это результаты, представленные разработчиками, а не доказательство того, что модель одинаково хорошо справится с любым новым роботом или что дистанционное управление больше не потребуется. 7
8
13
В открытый доступ выложены веса модели, код, технический отчёт и материалы для оценки INSIGHT-Bench; выпуск описан как распространяемый по лицензии Apache 2.0. Это даёт возможность изучать и проверять подход. Его практическое обещание пока точнее формулировать так: общая модель и повторно используемые виртуальные среды могут сократить потребность в отдельных демонстрациях, но эффективность нужно проверять на конкретном роботе и в конкретных условиях. 2
5
10
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
LightNav 0 построена на Qwen3 VL 4B и объединяет выполнение инструкций, поиск объектов по описанию и визуальное отслеживание в одной модели.
LightNav 0 построена на Qwen3 VL 4B и объединяет выполнение инструкций, поиск объектов по описанию и визуальное отслеживание в одной модели. По данным Light Origins, более 2000 реальных сцен стали основой для свыше 4000 часов навигационного опыта в симуляции.
Разработчики сообщают о высоких результатах в 10 симуляционных условиях и переносе модели между типами роботов без дополнительного обучения, но работу на конкретном роботе всё равно нужно проверять.