Em 22 de setembro de 2026, a equipe de modelos de base da Li Auto apresentou o sistema ME Brain 1.0, o modelo de visão e linguagem ME VLM e o modelo de compreensão e geração de ações ME U0. As taxas de sucesso divulgadas para o ME U0 — 99,1% no LIBERO e 81,8% no LIBERO Plus — vieram após adaptação aos próprios teste...
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Li Auto’s Foundation Model team release in its September 22, 2026, MachEmbodied embodied-AI trilogy, and how do ME-Brain-1.0, ME-VL. Article summary: Li Auto’s Foundation Model team presented three complementary pieces on September 22: ME-Brain-1.0 as an embodied-agent system, ME-VLM as its vision-language cognitive core, and ME-U0 as a model for understanding scenes . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Um robô precisa fazer mais do que reconhecer objetos: deve interpretar a tarefa, decidir como agir e executar movimentos úteis. É essa sequência que ajuda a entender os três lançamentos apresentados pela equipe de modelos de base da Li Auto em 22 de setembro de 2026. O ME-Brain-1.0 é descrito como o sistema mais amplo; o ME-VLM, como modelo de visão e linguagem para cognição e coordenação; e o ME-U0, como elo entre compreensão e geração de ações. As publicações, porém, não comprovam que tudo já tenha sido validado em conjunto em um robô autônomo rodando no chip M100. 3
5
ME-Brain-1.0 organiza a proposta de sistema. A Li Auto o apresenta em torno de memória, cognição e ação. Segundo a cobertura do lançamento, módulos ligados à memória podem operar no M100, um sistema em chip (SoC), para gerar e recuperar informações no próprio dispositivo. Isso não equivale a dizer que todos os componentes do ME-Brain rodem localmente. 3
5
ME-VLM trabalha na interpretação visual e na coordenação de agentes. Seu relatório técnico descreve treinamento com tarefas de robótica e de agentes multimodais, incluindo observações da execução e feedback para avaliar resultados e ajustar decisões. Foram divulgadas uma versão maior, 35B-A3B, com arquitetura de mistura de especialistas, e outra de 4 bilhões de parâmetros, voltada à execução no dispositivo. 1
5
ME-U0 procura transformar entendimento em ação. A arquitetura descrita como Mixture-of-Transformers conecta especialistas que interpretam tarefas e cenas a especialistas responsáveis pela geração de ações. Saber identificar o que deve ser feito é diferente de produzir movimentos que funcionem; o ME-U0 busca aproximar essas duas etapas. A descrição das peças como complementares não é, por si só, um teste do sistema integrado. 2
5
Nas tabelas de comparação da Li Auto, a versão maior do ME-VLM teria obtido médias de aproximadamente 70,9 em conjuntos de avaliação de tarefas de robótica e 72,5 em avaliações de agentes. A versão de 4 bilhões de parâmetros aparece em segundo lugar nessas comparações da empresa. Sem conhecer integralmente as condições dos testes e sem reprodução independente, essas pontuações não devem ser tratadas como medida geral de confiabilidade robótica. 5
Para o ME-U0, a empresa divulgou 17,66 pontos no RoboDojo e taxas médias de sucesso de 99,1% no LIBERO e 81,8% no LIBERO-Plus. Os resultados no LIBERO vieram depois de uma adaptação com supervisão fornecida por cada avaliação. Portanto, não são taxas de sucesso obtidas sem adaptação prévia em tarefas físicas desconhecidas. 3
A Li Auto afirma ter selecionado cerca de 4.200 horas para o pré-treinamento do ME-U0 a partir de conjuntos brutos com aproximadamente 5.700 horas de dados de robôs e 3.920 horas de vídeo em primeira pessoa. Combinar essas fontes pode ampliar a variedade de situações visuais vistas pelo modelo, mas o volume de dados não demonstra, sozinho, que ele funcionará em outro robô ou ambiente. 3
Para a versão de 4 bilhões de parâmetros do ME-VLM, os autores relatam compressão de tokens visuais, quantização W4A8 e otimização conjunta de hardware e software no M100. Segundo eles, essas medidas reduziram de 400 para 188 milissegundos a latência de prefill, etapa inicial do processamento de uma entrada pelo modelo. Esse número não mede o intervalo completo entre o robô perceber uma mudança e terminar uma resposta física. O material citado tampouco estabelece que o modelo 35B-A3B, o ME-U0 e todo o ME-Brain operem juntos em um único M100. 1
5
A cobertura do lançamento descreve uma demonstração de preensão de objetos com duração de uma hora e uma sequência de preparo de café de cerca de quatro minutos, com 15 etapas. Elas mostram tarefas escolhidas para apresentação pela Li Auto; não fornecem taxas de sucesso com objetos, iluminação e interrupções selecionados de forma independente, nem evidências sobre uso prolongado. As fontes citadas também não sustentam uma conclusão mais específica de terceiros sobre falhas nessas demonstrações. 3
O próximo passo decisivo seria avaliar o sistema integrado em testes reproduzíveis e definidos de forma independente: medir sucesso e recuperação após falhas em cenários desconhecidos, além da latência completa da percepção à ação no hardware informado. Até lá, as pontuações e a melhora no prefill são evidências distintas de potencial — não um veredito sobre robótica de uso geral. 1
3
5
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Em 22 de setembro de 2026, a equipe de modelos de base da Li Auto apresentou o sistema ME Brain 1.0, o modelo de visão e linguagem ME VLM e o modelo de compreensão e geração de ações ME U0.
Em 22 de setembro de 2026, a equipe de modelos de base da Li Auto apresentou o sistema ME Brain 1.0, o modelo de visão e linguagem ME VLM e o modelo de compreensão e geração de ações ME U0. As taxas de sucesso divulgadas para o ME U0 — 99,1% no LIBERO e 81,8% no LIBERO Plus — vieram após adaptação aos próprios testes, não de execução sem treinamento prévio em tarefas físicas desconhecidas.
A versão de 4 bilhões de parâmetros do ME VLM roda no chip M100, segundo os autores, mas isso não demonstra que toda a arquitetura funcione junta nesse hardware.