LightNav 0 以 Qwen3 VL 為基礎,利用單一前視 RGB 影像與語言提示,處理指令跟隨、開放詞彙物件導航及視覺目標追蹤等任務。 模型以「可通行方向」與「目標物」兩個指向 token,再加上三個殘差向量量化動作 token,產生 10 步的 SE(2) 航點軌跡。[1] Light Origins 表示,系統利用超過 2,000 個室內外場景合成逾 4,000 小時資料;其跨機器人與 10 項模擬評測表現仍主要屬於作者公布結果,尚待獨立真實世界驗證。[1][10]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0 navigation model, published on September 17, 2026, and how do its Qwen3-VL-4B backbone, unifi. Article summary: LightNav-0 is a compact, general-purpose embodied-navigation policy built from Qwen3-VL-4B-Instruct. It uses a single stream of egocentric RGB observations plus a language instruction to handle route following, open-voca. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
LightNav-0 是 Light Origins 推出的開源通用具身導航模型。它的目標,是讓機器人只靠前方 RGB 攝影機畫面與自然語言指令,就能理解「往哪裡走」、尋找指定物件,或持續追蹤畫面中的目標,並直接產生移動航點。
它不是為每種導航任務各做一個模型,而是以 Qwen3-VL 視覺語言模型為基礎,建立一套共用的感知、語言與動作介面;官方稱已同步釋出模型、程式碼與技術報告。1
5
10
值得先釐清的是發布日期:官方公告日期為 2026 年 9 月 1 日;GitHub 顯示的 9 月 17 日,是後續提交紀錄,並非最初發布日。5
10
對機器人而言,理解「沿走廊走到電梯旁」、「去找紅色椅子」與「跟著前方的人」看似是三種不同問題。LightNav-0 的做法,是不論任務類型為何,都以相同格式表達導航決策。
模型先預測兩個對應影像網格位置的指向 token:
接著,模型輸出三個殘差向量量化動作 token,解碼成一段 10 步的 SE(2) 航點軌跡。論文中,分層動作碼本依序處理約 0.9 公尺尺度的決策,再細化至約 7 公分與 4 公分的調整。1
換句話說,語言指令或物件描述改變的是「要做什麼」,但模型對外輸出的空間意圖與移動軌跡格式不變。作者將其稱為不依賴任務、場景或機器人本體的統一 token 介面。1
LightNav-0 以 Qwen3-VL-4B-Instruct 視覺語言模型為骨幹,嘗試把原本用於看圖與理解語言的空間能力,對齊到實際導航動作,而非為每項任務或每種機器人另加專屬預測頭。1
在其報告的單目評測中,模型使用自我視角的視覺輸入,不依賴深度感測器、里程計或全景相機。介面因此相對直接:影像加語言輸入,轉為空間指向與航點輸出。1
不過,模型介面簡化不代表部署工作消失。實際裝機仍須處理攝影機校正、低階控制器、航點安全執行,以及目標環境中的測試與風險控管。
機器人學習常見瓶頸,在於實體機器人示範資料昂貴、耗時且不容易涵蓋足夠多樣的場景。Light Origins 提出的 Real2Sim2Real 管線,意在把更多資料生成流程移到可重複利用的模擬環境中。
依公司說法,團隊將超過 2,000 個取自網路的室內外場景轉為模擬資產,並合成超過 4,000 小時的視覺—語言—動作對齊經驗。訓練分為三個階段:10
資料生成期間還會隨機化攝影機視角、架設高度與俯仰角,目的是避免模型過度依賴某一種固定鏡頭位置,提升轉移到不同機器人本體時的適應性。1
這種方法有機會降低導航訓練對反覆遙操作資料收集的依賴,但不表示真實世界資料已不重要。模擬與現場的落差、感測器差異、控制延遲、障礙物安全,以及複雜戶外情況,仍是部署時必須面對的問題。
論文指出,LightNav-0 以同一個檢查點,在 10 項模擬導航評測中取得領先的單目結果;官方也表示,模型可在未見過的場景中零樣本遷移到人形、四足、輪式與飛行機器人。1
10
這些結果的意義在於,測試的不是只針對單一機器人或單一基準調校的模型,而是同一策略能否跨任務與跨本體運作。不過,這些目前仍以作者報告為主。模型是否真能在開放、非受控的室內外真實環境中穩定運行,仍有賴第三方重現與更多實機測試。
公開 GitHub 儲存庫將 LightNav-0 描述為基於 Qwen3-VL 的通用具身導航模型,並說明其共用 token 介面。5 Light Origins 則表示,此次開放內容包括模型、程式碼與技術報告。
10
對想導入的團隊來說,問題不只是模型能否執行,而是下列條件是否吻合目標機器人:
在進入產品或商業部署前,也應確認當前釋出檔案及其授權條款。
LightNav-0 提出的是一套值得關注的導航方法:以較精簡的視覺語言模型為核心,用相同的「指向加航點」token 表示不同導航任務,再透過 Real2Sim2Real 管線擴大訓練資料供給。1
10
若其跨機器人的遷移能力能通過獨立、真實世界的驗證,未來開發導航系統或許不必每換一種機器人、每新增一項任務,就從頭蒐集大量遙操作示範資料。現階段較合適的定位是:它是一個開放且技術路線明確的研究與部署起點,而非已證明單一 RGB 相機加語言模型能在任何地方解決通用導航的定論。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
LightNav 0 以 Qwen3 VL 為基礎,利用單一前視 RGB 影像與語言提示,處理指令跟隨、開放詞彙物件導航及視覺目標追蹤等任務。
LightNav 0 以 Qwen3 VL 為基礎,利用單一前視 RGB 影像與語言提示,處理指令跟隨、開放詞彙物件導航及視覺目標追蹤等任務。 模型以「可通行方向」與「目標物」兩個指向 token,再加上三個殘差向量量化動作 token,產生 10 步的 SE(2) 航點軌跡。[1]
Light Origins 表示,系統利用超過 2,000 個室內外場景合成逾 4,000 小時資料;其跨機器人與 10 項模擬評測表現仍主要屬於作者公布結果,尚待獨立真實世界驗證。[1][10]