22 września 2026 r. zespół Li Auto przedstawił ME Brain 1.0 jako koncepcję systemu AI dla robotów, ME VLM jako model rozumienia obrazu i języka oraz ME U0 jako model łączący rozumienie z generowaniem działań.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Li Auto’s Foundation Model team release in its September 22, 2026, MachEmbodied embodied-AI trilogy, and how do ME-Brain-1.0, ME-VL. Article summary: Li Auto’s Foundation Model team presented three complementary pieces on September 22: ME-Brain-1.0 as an embodied-agent system, ME-VLM as its vision-language cognitive core, and ME-U0 as a model for understanding scenes . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Robot może rozpoznać przedmiot i zrozumieć polecenie, a mimo to nie poradzić sobie z jego uchwyceniem. To różnica, którą warto mieć na uwadze przy ocenie trzech projektów pokazanych przez zespół Foundation Model firmy Li Auto 22 września 2026 r.: systemu ME-Brain-1.0, modelu wizualno-językowego MachEmbodied-VLM (ME-VLM) oraz modelu MachEmbodied-U0 (ME-U0), łączącego rozumienie z generowaniem działań. Razem wyznaczają kierunek od obserwacji otoczenia do działania, lecz dostępne materiały nie dowodzą, że całość przetestowano niezależnie jako jednego autonomicznego robota. 3
5
ME-Brain-1.0 to koncepcja systemu obejmującego pamięć, procesy poznawcze i działanie. Według doniesień moduły związane z pamięcią mogą działać na układzie M100 firmy Li Auto, zapisując i wyszukując informacje bezpośrednio na urządzeniu. Nie oznacza to, że wszystkie części ME-Brain pracują lokalnie na tym układzie. 3
5
ME-VLM ma odpowiadać za rozumienie informacji wizualnych i językowych oraz koordynację zadań wykonywanych przez agenta AI. Autorzy raportu technicznego opisują trening obejmujący zadania związane z robotyką i agentami multimodalnymi, w tym obserwacje wykonania oraz informacje zwrotne służące ocenie rezultatów. Opisywana jest duża wersja 35B-A3B typu mixture of experts oraz mniejsza wersja 4B, przeznaczona do działania na urządzeniu końcowym. 1
5
ME-U0 ma wypełniać lukę między zrozumieniem zadania a wytworzeniem działań robota. Opisywana architektura Mixture-of-Transformers łączy wyspecjalizowane części modelu służące rozumieniu z częściami odpowiedzialnymi za generowanie. To opis komplementarnych ról trzech projektów, a nie dowód, że zostały już sprawdzone razem w jednym autonomicznym wdrożeniu. 2
5
W tabelach porównawczych Li Auto duży ME-VLM uzyskał według doniesień średnio około 70,9 punktu w zestawach testów związanych z robotyką i 72,5 punktu w testach agentów AI. Wersja 4B zajęła w tych firmowych porównaniach drugie miejsce. Bez pełnych warunków testowania i niezależnego powtórzenia wyników nie są to jednak ogólne miary niezawodności robota. 5
Li Auto podaje dla ME-U0 17,66 punktu w RoboDojo oraz średnią skuteczność 99,1% w LIBERO i 81,8% w LIBERO-Plus. Są to wyniki po dostosowaniu modelu z użyciem danych nadzorczych udostępnionych przez każdy z tych zestawów testowych. Nie należy ich utożsamiać ze skutecznością na nieznanych zadaniach fizycznych bez wcześniejszego dostosowania. 3
Według Li Auto do wstępnego treningu ME-U0 wybrano około 4200 godzin danych z pul obejmujących mniej więcej 5700 godzin danych z robotów i 3920 godzin nagrań z perspektywy pierwszej osoby. Taki dobór może poszerzać zakres sytuacji wizualnych dostępnych modelowi, ale sama liczba godzin nie pokazuje, jak poradzi sobie on z nowym robotem lub w nowym otoczeniu. 3
W przypadku ME-VLM autorzy opisują kompresję tokenów wizualnych, kwantyzację W4A8 oraz wspólną optymalizację oprogramowania i sprzętu dla wersji 4B działającej na układzie M100. Według ich pomiarów czas prefill — wstępnego etapu przetwarzania danych wejściowych — spadł z 400 do 188 ms. Nie jest to czas od zauważenia zmiany przez robota do wykonania fizycznej reakcji. Przytoczone materiały nie potwierdzają też, że model 35B-A3B lub kompletny zestaw ME-Brain i ME-U0 działa razem na jednym M100. 1
5
Relacje z premiery opisują około godzinny pokaz chwytania przedmiotów oraz mniej więcej czterominutową sekwencję przygotowania kawy, obejmującą 15 kroków. Pokazują one zadania wybrane przez Li Auto, ale nie określają skuteczności przy przedmiotach i warunkach dobranych niezależnie, zakłóceniach czy długotrwałym użytkowaniu. Dostępne przytoczone materiały nie uzasadniają również bardziej szczegółowych twierdzeń o błędach zaobserwowanych w tych pokazach przez podmiot zewnętrzny. 3
Najbardziej miarodajny kolejny krok to niezależny, powtarzalny test zintegrowanego systemu: skuteczności na nieznanych stanowiskach, radzenia sobie z błędami oraz pełnego czasu od percepcji do działania na wskazanym sprzęcie. Do tego czasu wyniki testów i pomiar prefill na M100 pozostają obiecującymi, lecz odrębnymi danymi — nie ostateczną oceną możliwości robota. 1
3
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
22 września 2026 r. zespół Li Auto przedstawił ME Brain 1.0 jako koncepcję systemu AI dla robotów, ME VLM jako model rozumienia obrazu i języka oraz ME U0 jako model łączący rozumienie z generowaniem działań.
22 września 2026 r. zespół Li Auto przedstawił ME Brain 1.0 jako koncepcję systemu AI dla robotów, ME VLM jako model rozumienia obrazu i języka oraz ME U0 jako model łączący rozumienie z generowaniem działań. Deklarowane skuteczności ME U0 — 99,1% w LIBERO i 81,8% w LIBERO Plus — uzyskano po dostosowaniu modelu na podstawie danych nadzorczych dostępnych w tych testach.
Na układzie M100 zmierzono skrócenie etapu wstępnego przetwarzania w wersji ME VLM 4B z 400 do 188 ms.