LightNav 0 dùng một mô hình dựa trên Qwen3 VL 4B để làm theo chỉ dẫn, tìm vật thể được mô tả bằng ngôn ngữ tự nhiên và bám theo mục tiêu qua hình ảnh. Mô hình tách ý định di chuyển có thể dùng chung khỏi quỹ đạo hành động phù hợp với từng loại robot.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Một robot học cách đi theo chỉ dẫn chưa chắc đã biết cách tìm một vật thể được gọi tên, càng chưa chắc áp dụng được cách di chuyển đó cho một loại robot khác. LightNav-0 là nỗ lực của Light Origins nhằm gom các bài toán ấy vào một mô hình điều hướng, thay vì thu thập một bộ dữ liệu người điều khiển robot từ xa cho từng nhiệm vụ và từng loại robot. Mô hình được xây dựng trên Qwen3-VL-4B, phục vụ việc làm theo chỉ dẫn, tìm vật thể được mô tả bằng ngôn ngữ tự nhiên và bám theo mục tiêu qua hình ảnh. 1
2
8
LightNav-0 không thêm một nhánh dự đoán riêng cho mỗi nhiệm vụ. Thay vào đó, các nhiệm vụ dùng chung một giao diện token — những đơn vị biểu diễn mà mô hình xử lý. Token chỉ hướng hai kênh thể hiện ý định di chuyển trong không gian, được thiết kế để có thể áp dụng qua nhiều nhiệm vụ, bối cảnh và loại robot. Bộ mã hóa hành động lượng tử hóa vectơ phần dư biểu diễn quỹ đạo cụ thể, phù hợp với cách di chuyển của từng robot. Mô hình còn nén lịch sử hình ảnh theo thời gian để tận dụng những gì đã quan sát ở các thời điểm trước. 1
5
Điểm mấu chốt là robot có thể chia sẻ biểu diễn về nơi cần đến mà không bị giả định là phải di chuyển giống nhau. Đây là thiết kế hướng tới khả năng chuyển giao, không phải lời bảo đảm rằng một robot hoàn toàn mới sẽ hoạt động ngay mà không cần điều chỉnh. 1
5
Quy trình Real2Sim2Real của Light Origins biến cảnh thực thành môi trường mô phỏng có thể tái sử dụng để huấn luyện điều hướng. Công ty cho biết đã dùng hơn 2.000 cảnh thực lấy từ internet để tạo hơn 4.000 giờ trải nghiệm điều hướng kết hợp hình ảnh, ngôn ngữ và hành động. Cách làm này giúp tạo nhiều tình huống huấn luyện mà không chỉ dựa vào các lượt trình diễn do con người điều khiển robot từ xa. Tuy nhiên, hai con số trên mô tả quy mô dữ liệu do công ty công bố, không phải mức tiết kiệm chi phí thu thập dữ liệu thực tế đã được đo lường. 8
Light Origins mô tả ba giai đoạn huấn luyện: huấn luyện trung gian về suy luận hiện thân, tinh chỉnh có giám sát cho nhiệm vụ hiện thân và học tăng cường trực tuyến. Chúng nhằm đưa năng lực của mô hình thị giác–ngôn ngữ nền vào bài toán điều hướng, dạy cách sử dụng giao diện token chung rồi cải thiện chính sách điều khiển thông qua tương tác. 1
8
Theo Light Origins, LightNav-0 đạt tỷ lệ thành công hàng đầu khi điều hướng bằng hình ảnh từ một camera trong 10 thiết lập mô phỏng công khai, gồm làm theo chỉ dẫn, đi tới vật thể mục tiêu và bám theo mục tiêu qua hình ảnh. Nhóm cũng báo cáo khả năng chuyển sang các loại robot và cảnh thực chưa gặp trong huấn luyện mà không cần huấn luyện bổ sung cho từng trường hợp. Đây là kết quả do nhóm công bố, không phải tỷ lệ thành công chung cho mọi robot lạ, cũng không chứng minh rằng có thể bỏ hẳn việc thu thập dữ liệu bằng điều khiển từ xa. 7
8
13
Trọng số mô hình, mã nguồn, báo cáo kỹ thuật và tài liệu đánh giá INSIGHT-Bench đã được phát hành; bản phát hành được mô tả là theo giấy phép Apache 2.0. Nhờ đó, các nhóm khác có cơ sở để kiểm tra và thử nghiệm phương pháp. Giá trị thực tiễn mà LightNav-0 hướng tới là giảm nhu cầu thu thập bản trình diễn riêng cho từng robot nhờ môi trường mô phỏng tái sử dụng và chính sách điều hướng dùng chung — còn hiệu quả trên robot và môi trường cụ thể vẫn cần được kiểm chứng. 2
5
10
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
LightNav 0 dùng một mô hình dựa trên Qwen3 VL 4B để làm theo chỉ dẫn, tìm vật thể được mô tả bằng ngôn ngữ tự nhiên và bám theo mục tiêu qua hình ảnh.
LightNav 0 dùng một mô hình dựa trên Qwen3 VL 4B để làm theo chỉ dẫn, tìm vật thể được mô tả bằng ngôn ngữ tự nhiên và bám theo mục tiêu qua hình ảnh. Mô hình tách ý định di chuyển có thể dùng chung khỏi quỹ đạo hành động phù hợp với từng loại robot.
Light Origins cho biết đã tạo hơn 4.000 giờ trải nghiệm điều hướng mô phỏng từ hơn 2.000 cảnh thực; các kết quả công bố chưa chứng minh có thể loại bỏ hoàn toàn dữ liệu thu bằng điều khiển từ xa.