Em um pipeline VLA tradicional, o sistema segue um processo sequencial: o carro vê a estrada, traduz essa percepção visual em tokens semelhantes à linguagem e, em seguida, raciocina sobre esses tokens linguísticos para gerar uma ação de direção. O Dr. Liu descreveu essa etapa intermediária como uma fraqueza crítica, afirmando de forma direta que “idioma é veneno” para a direção em tempo real . Seu argumento é que os tokens de linguagem introduzem latência inerente e injetam ruído semântico irrelevante em um processo que exige reações na casa dos milissegundos.
O modelo VLA 2.0 elimina esse gargalo por completo. Ele adota o que a empresa chama de caminho “Visão-Token Implícito-Ação”, permitindo uma geração de comandos de direção de ponta a ponta, diretamente a partir de entradas visuais brutas, sem qualquer representação de linguagem intermediária . Embora o sistema ainda possa aceitar a linguagem como uma entrada — como um comando de navegação do motorista ou uma instrução falada — ele nunca cria seus próprios tokens de linguagem como uma saída interna durante o ato de dirigir
. A XPeng exibiu o sistema em seu estande na CVPR, juntamente com um modelo de mundo físico de IA, e um artigo de pesquisa relacionado, DrivePTS, foi aceito para publicação na conferência
.
A liderança da XPeng não tem sido modesta ao fazer comparações diretas com a Tesla. Suas declarações durante a primavera e o verão de 2026 representam uma forte escalada de confiança. O Dr. Liu afirmou em sua entrevista de junho que a XPeng já alcançou a paridade com o FSD v13 da Tesla na China e que igualar o desempenho do mais recente FSD v14 está “ao alcance antes do final do verão” .
Essas alegações técnicas são respaldadas por um compromisso pessoal incomum do alto escalão. Em dezembro de 2025, o CEO He Xiaopeng fez uma “aposta de desempenho” pública, declarando que o sistema VLA da XPeng deve igualar a experiência nas ruas do FSD v14.2 da Tesla no Vale do Silício até 30 de agosto de 2026 . As apostas foram explicitadas: se a equipe falhasse, o responsável teria que “correr pelado”
.
Para apoiar sua narrativa, a XPeng divulgou um vídeo comparativo em maio de 2026, trazendo dois entusiastas da Tesla baseados nos EUA para a China. A comparação encenada colocou um XPeng P7 rodando o VLA 2.0 contra um Tesla Model 3 com FSD em rotas idênticas em Pequim. De acordo com a própria versão do vídeo, seu veículo exigiu apenas 2 intervenções do motorista, em comparação com 7 do Tesla . Embora He Xiaopeng tenha reiterado em vários eventos, incluindo a Auto China 2026, que a meta é superar totalmente o FSD da Tesla no mercado chinês até agosto, as análises independentes recomendam cautela. Um editor do Electrek que testou o VLA 2.0 em Pequim descreveu seu desempenho como “comparável” ao FSD v14, mas observou que ambos os sistemas ainda exigem atenção constante do motorista e estão longe de serem totalmente autônomos
.
Por ora, a corrida permanece uma perseguição em alta velocidade, definida por apostas arquitetônicas ousadas e alegações ainda mais audaciosas. A decisão da XPeng de projetar a linguagem para fora de seu cérebro de direção é uma aposta calculada de que o caminho mais rápido da visão para a ação é uma linha reta — mesmo que isso signifique jogar o dicionário pela janela.