Ngày 22/9/2026, nhóm phát triển mô hình nền tảng của Li Auto giới thiệu ME Brain 1.0 ở cấp hệ thống, ME VLM cho nhận biết bằng hình ảnh và ngôn ngữ, cùng ME U0 để nối phần hiểu nhiệm vụ với tạo hành động. ME U0 được báo cáo đạt tỷ lệ thành công trung bình 99,1% trên LIBERO và 81,8% trên LIBERO Plus sau khi điều chỉn...
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Li Auto’s Foundation Model team release in its September 22, 2026, MachEmbodied embodied-AI trilogy, and how do ME-Brain-1.0, ME-VL. Article summary: Li Auto’s Foundation Model team presented three complementary pieces on September 22: ME-Brain-1.0 as an embodied-agent system, ME-VLM as its vision-language cognitive core, and ME-U0 as a model for understanding scenes . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Một robot muốn làm theo yêu cầu không chỉ cần nhận ra vật thể. Nó còn phải hiểu nhiệm vụ, chọn cách thao tác và tạo ra hành động phù hợp. Ba công bố MachEmbodied của nhóm phát triển mô hình nền tảng Li Auto ngày 22/9/2026 hướng tới các phần việc đó: ME-Brain-1.0 là khung hệ thống, ME-VLM đảm nhiệm nhận biết và suy luận từ hình ảnh cùng ngôn ngữ, còn ME-U0 kết nối việc hiểu tình huống với tạo hành động. Đây là cách các công bố được định vị, chưa phải bằng chứng cả ba đã được kiểm chứng độc lập khi cùng vận hành trên một robot. 3
5
ME-Brain-1.0 được Li Auto mô tả theo ba chức năng: ghi nhớ, nhận biết và hành động. Theo thông tin về đợt ra mắt, các mô-đun liên quan đến bộ nhớ có thể chạy trên M100, hệ thống trên chip (SoC) của hãng, để tạo và truy xuất thông tin ngay trên thiết bị. Điều đó không đồng nghĩa toàn bộ ME-Brain đều chạy cục bộ trên một chip M100. 3
5
ME-VLM là mô hình kết hợp thị giác và ngôn ngữ. Báo cáo kỹ thuật mô tả quá trình huấn luyện trên các nhiệm vụ AI hiện thân và tác nhân đa phương thức, có sử dụng quan sát cùng phản hồi về kết quả để hỗ trợ đánh giá, điều chỉnh quyết định. Các nguồn tường thuật nêu hai phiên bản: mô hình 35B-A3B theo kiến trúc mixture-of-experts và bản 4B nhỏ hơn, hướng đến triển khai trên thiết bị. 1
5
ME-U0 tập trung vào khoảng cách giữa “biết cần làm gì” và “tạo được động tác”. Thiết kế Mixture-of-Transformers được mô tả là kết nối các thành phần chuyên về hiểu nhiệm vụ, cảnh vật với các thành phần chuyên tạo hành động. Ba công bố vì thế bổ trợ nhau về mặt kiến trúc; tài liệu được dẫn chưa chứng minh chúng đã chạy cùng nhau trong một hệ thống robot tự chủ được đánh giá độc lập. 2
5
Trong bảng so sánh do Li Auto công bố, ME-VLM bản lớn đạt điểm trung bình khoảng 70,9 trên nhóm bộ thử nghiệm AI hiện thân và 72,5 trên nhóm bộ thử nghiệm tác nhân; bản 4B đứng thứ hai trong các so sánh đó. Đây là kết quả được báo cáo trong phạm vi thử nghiệm của hãng, không phải thước đo chung về độ tin cậy của robot ngoài thực tế. 5
Với ME-U0, Li Auto báo cáo 17,66 điểm trên RoboDojo, cùng tỷ lệ thành công trung bình 99,1% trên LIBERO và 81,8% trên LIBERO-Plus. Điểm cần lưu ý là các kết quả LIBERO có bước điều chỉnh mô hình bằng tín hiệu giám sát do từng bộ thử nghiệm cung cấp. Vì vậy, không thể diễn giải chúng thành tỷ lệ thành công zero-shot — tức làm được ngay, không điều chỉnh trước — trên những nhiệm vụ vật lý xa lạ. 3
Li Auto cho biết đã chọn khoảng 4.200 giờ dữ liệu để tiền huấn luyện ME-U0 từ các nguồn ban đầu gồm khoảng 5.700 giờ dữ liệu robot và 3.920 giờ video góc nhìn thứ nhất. Việc kết hợp các nguồn này có thể giúp mô hình tiếp xúc với nhiều tình huống hình ảnh hơn những gì có trong dữ liệu robot. Tuy nhiên, số giờ dữ liệu tự nó không cho biết mô hình sẽ chuyển sang một robot hay môi trường mới hiệu quả đến đâu. 3
Đối với ME-VLM bản 4B, các tác giả báo cáo việc nén token hình ảnh, lượng tử hóa W4A8 và tối ưu phối hợp phần cứng–phần mềm giúp mô hình suy luận trên M100. Họ ghi nhận độ trễ prefill — giai đoạn xử lý đầu vào khi suy luận — giảm từ 400 ms xuống 188 ms. Đây không phải số đo toàn bộ thời gian từ lúc robot thấy một thay đổi đến khi hoàn tất phản ứng vật lý. Tài liệu được dẫn cũng chưa xác lập rằng bản 35B-A3B, toàn bộ ME-Brain và ME-U0 có thể cùng chạy trên một M100. 1
5
Thông tin về đợt ra mắt mô tả một màn gắp đồ vật kéo dài một giờ và quy trình pha cà phê khoảng bốn phút, gồm 15 bước. Chúng minh họa những nhiệm vụ Li Auto lựa chọn trình diễn, nhưng không xác lập tỷ lệ thành công khi người đánh giá độc lập chọn vật thể, thay đổi ánh sáng, gây gián đoạn hoặc cho robot hoạt động lặp lại trong thời gian dài. Các tài liệu được dẫn cũng không đủ cơ sở để khẳng định có một kết luận cụ thể từ bên thứ ba về lỗi trong những màn trình diễn này. 3
Phép thử thuyết phục hơn sẽ là đánh giá cả hệ thống tích hợp theo quy trình có thể lặp lại và do bên độc lập xác định: tỷ lệ hoàn thành nhiệm vụ trong bối cảnh chưa quen, khả năng phục hồi sau lỗi và độ trễ đầy đủ từ nhận biết đến hành động trên phần cứng được nêu. Trước khi có những kết quả đó, điểm thử nghiệm và độ trễ prefill trên M100 vẫn là các bằng chứng riêng biệt, chưa phải kết luận về một robot đa năng đáng tin cậy. 1
3
5
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ngày 22/9/2026, nhóm phát triển mô hình nền tảng của Li Auto giới thiệu ME Brain 1.0 ở cấp hệ thống, ME VLM cho nhận biết bằng hình ảnh và ngôn ngữ, cùng ME U0 để nối phần hiểu nhiệm vụ với tạo hành động.
Ngày 22/9/2026, nhóm phát triển mô hình nền tảng của Li Auto giới thiệu ME Brain 1.0 ở cấp hệ thống, ME VLM cho nhận biết bằng hình ảnh và ngôn ngữ, cùng ME U0 để nối phần hiểu nhiệm vụ với tạo hành động. ME U0 được báo cáo đạt tỷ lệ thành công trung bình 99,1% trên LIBERO và 81,8% trên LIBERO Plus sau khi điều chỉnh bằng dữ liệu giám sát của từng bộ thử nghiệm; đó không phải tỷ lệ thành công khi gặp nhiệm vụ thực tế h...
ME VLM bản 4B được báo cáo chạy trên chip M100 với độ trễ giai đoạn xử lý đầu vào giảm từ 400 xuống 188 ms.