Li Auto stellte am 22. September 2026 ME Brain 1.0 als Systemkonzept, ME VLM für visuell sprachliches Verstehen und ME U0 für Verstehen und Handlungserzeugung vor.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Li Auto’s Foundation Model team release in its September 22, 2026, MachEmbodied embodied-AI trilogy, and how do ME-Brain-1.0, ME-VL. Article summary: Li Auto’s Foundation Model team presented three complementary pieces on September 22: ME-Brain-1.0 as an embodied-agent system, ME-VLM as its vision-language cognitive core, and ME-U0 as a model for understanding scenes . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Ein Roboter muss seine Umgebung erfassen, eine Aufgabe verstehen und daraus passende Bewegungen ableiten. Für diese Schritte stellte das Foundation-Model-Team des chinesischen Autobauers Li Auto am 22. September 2026 drei MachEmbodied-Veröffentlichungen vor: ME-Brain-1.0, MachEmbodied-VLM (ME-VLM) und MachEmbodied-U0 (ME-U0). Zusammen skizzieren sie einen Weg von der Beobachtung zur Handlung. Dass alle drei bereits als durchgängiges Robotersystem auf einem einzelnen Chip unabhängig geprüft wurden, belegen die Veröffentlichungen jedoch nicht. 3
5
ME-Brain-1.0 ist das übergeordnete Systemkonzept. Li Auto beschreibt es anhand von Gedächtnis, kognitiver Verarbeitung und Handlung. Berichten zufolge können gedächtnisbezogene Module auf dem hauseigenen M100-System-on-Chip (SoC) Daten direkt auf dem Gerät erzeugen und abrufen. Daraus folgt nicht, dass sämtliche Teile von ME-Brain lokal auf diesem Chip laufen. 3
5
ME-VLM übernimmt visuell-sprachliche Verarbeitung und die Koordination von KI-Agenten. Sein technischer Bericht beschreibt ein Training mit Aufgaben aus der verkörperten KI und mit multimodalen Agenten, einschließlich Beobachtungen und Rückmeldungen zur Bewertung von Ergebnissen. Berichtet wird über eine große Mixture-of-Experts-Version namens 35B-A3B und eine kleinere 4B-Version für den Einsatz direkt auf einem Gerät. 1
5
ME-U0 soll das Verstehen einer Szene mit der Erzeugung von Aktionen verbinden. Die beschriebene Mixture-of-Transformers-Architektur verknüpft dafür auf unterschiedliche Aufgaben spezialisierte Modellteile. Eine Aufgabe zu erkennen und sie mit einem Roboter zuverlässig auszuführen, sind allerdings zwei verschiedene Anforderungen. Die drei Veröffentlichungen ergänzen sich konzeptionell; sie sind kein Nachweis für einen gemeinsam validierten autonomen Betrieb. 2
5
In den berichteten Vergleichstabellen erreicht die große ME-VLM-Version im Mittel etwa 70,9 Punkte bei Benchmarks für verkörperte KI und 72,5 bei Agenten-Benchmarks. Die 4B-Version liegt in diesen Vergleichen des Unternehmens auf Rang zwei. Ohne vollständige Testbedingungen und unabhängige Wiederholung sagen solche Durchschnittswerte wenig über die Zuverlässigkeit bei wechselnden realen Aufgaben aus. 5
Für ME-U0 nennt Li Auto 17,66 Punkte auf RoboDojo sowie durchschnittliche Erfolgsquoten von 99,1 % auf LIBERO und 81,8 % auf LIBERO-Plus. Vor den LIBERO-Tests wurde das Modell mit den von den jeweiligen Benchmarks bereitgestellten Trainingssignalen angepasst. Die Quoten sind daher keine Erfolgsraten für unbekannte physische Aufgaben ohne vorherige Anpassung. 3
Für das Vortraining von ME-U0 wählte Li Auto nach eigenen Angaben rund 4.200 Stunden Material aus Datenbeständen mit etwa 5.700 Stunden Roboterdaten und 3.920 Stunden Videos aus der Ich-Perspektive aus. Diese Mischung kann dem Modell mehr visuelle Situationen zeigen als Roboteraufnahmen allein. Die Stundenzahlen belegen aber nicht, wie gut es auf neue Roboter oder Umgebungen übertragbar ist. 3
Für ME-VLM in der 4B-Version berichten die Autoren über die Verdichtung visueller Eingabeeinheiten, W4A8-Quantisierung und eine gemeinsame Optimierung von Hard- und Software auf dem M100. Dadurch sei die Prefill-Latenz von 400 auf 188 Millisekunden gesunken. Prefill bezeichnet eine Phase der Modellverarbeitung – nicht die gesamte Zeit vom Wahrnehmen einer Veränderung bis zur ausgeführten Roboterbewegung. Die Quellen belegen weder, dass die große 35B-A3B-Version auf einem einzelnen M100 läuft, noch dass dort das komplette ME-Brain- und ME-U0-System gemeinsam betrieben wird. 1
5
Die Berichterstattung zum Start beschreibt eine etwa einstündige Greifvorführung und eine ungefähr vierminütige Kaffeezubereitung mit 15 Schritten. Solche Demonstrationen zeigen ausgewählte Aufgaben, liefern aber keine unabhängig ermittelten Erfolgsraten bei anderen Gegenständen, Lichtverhältnissen, Unterbrechungen oder längerem Betrieb. Eine konkrete Feststellung Dritter zu Fehlern in diesen Vorführungen ist durch das vorliegende Material nicht belegt. 3
Der entscheidende nächste Schritt wäre deshalb ein unabhängig festgelegter und wiederholbarer Test des integrierten Systems: mit unbekannten Aufgaben, dokumentierten Fehlschlägen und Korrekturen sowie einer Messung der vollständigen Zeit von der Wahrnehmung bis zur Handlung auf der genannten Hardware. Bis dahin sind Benchmarks und M100-Prefill-Wert interessante, aber getrennte Belege – kein Gesamturteil über einen vielseitig einsetzbaren Roboter. 1
3
5
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Li Auto stellte am 22. September 2026 ME Brain 1.0 als Systemkonzept, ME VLM für visuell sprachliches Verstehen und ME U0 für Verstehen und Handlungserzeugung vor.
Li Auto stellte am 22. September 2026 ME Brain 1.0 als Systemkonzept, ME VLM für visuell sprachliches Verstehen und ME U0 für Verstehen und Handlungserzeugung vor. Die für ME U0 gemeldeten Erfolgsquoten von 99,1 % auf LIBERO und 81,8 % auf LIBERO Plus wurden nach Anpassung an die jeweiligen Benchmarks erzielt – nicht ohne vorherige Anpassung an unbekannten Aufgaben.
Auf Li Autos M100 Chip sank laut technischem Bericht die Prefill Latenz der kleinen ME VLM Version von 400 auf 188 Millisekunden.