XPeng dépense 500 millions de dollars par an uniquement pour l'entraînement de ses modèles d'IA de conduite autonome, un budget distinct de son enveloppe R&D globale qui devrait presque doubler d'ici 2026. Lors du CVPR 2026, la marque a dévoilé VLA 2.0, une architecture qui supprime toute étape de « traduction » en...

Create a landscape editorial hero image for this Studio Global article: How much does Xpeng spend annually on AI model training for autonomous driving, what new VLA 2.0 architecture did it introduce at CVPR 2026. Article summary: Here are the answers to your three questions, based on recent reporting by Electrek and XPeng's official announcements.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 million) per month on AI training alone and believes it has already reac" source context "Xpeng spends $500M/year on AI training to beat Tesla FSD | Electrek" Reference image 2: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 millio
Dans une escalade verbale et technologique, le constructeur chinois XPeng a officiellement dévoilé son plan pour défier la domination de Tesla en matière de conduite autonome. Lors de la conférence CVPR en juin 2026, l'entreprise a présenté une architecture IA radicale qui abandonne un composant fondamental de la plupart des systèmes robotiques : le langage. Associée à la révélation de dépenses d'entraînement astronomiques, XPeng défend l'idée que son approche de nouvelle génération n'est pas seulement différente, mais fondamentalement plus rapide et plus fiable.
Le responsable IA de l'entreprise, le Dr Xianming Liu, à la tête du centre d'intelligence générale de XPeng, a confié au média spécialisé Electrek que la société dépense environ 300 millions de yuans par mois, soit près de 500 millions de dollars (environ 460 millions d'euros) par an, rien que pour l'entraînement de ses modèles d'IA . Ce chiffre ne couvre que la puissance de calcul brute nécessaire à l'apprentissage des modèles de conduite autonome, et non le budget total de R&D en IA. À titre de comparaison, les dépenses globales de XPeng liées à l'IA s'élevaient à environ 652 millions de dollars en 2025 et devraient grimper à près de 970 millions de dollars en 2026
.
La pièce maîtresse de la présence de XPeng au CVPR 2026 a été la présentation officielle de son modèle de deuxième génération Vision-Langage-Action, ou VLA 2.0. Cette architecture marque une rupture fondamentale avec la manière dont de nombreux systèmes d'IA, y compris le modèle de première génération de XPeng, abordent la conduite .
Dans un pipeline VLA classique, le système suit un processus en trois étapes : la voiture « voit » la route, traduit cette perception visuelle en jetons de type langage, puis raisonne sur ces « mots » pour générer une action. Le Dr Liu a décrit cette étape intermédiaire comme une faiblesse critique, affirmant sans détour que « le langage est un poison » pour la conduite en temps réel . Son argument est que les jetons de langage introduisent une latence inhérente et injectent un bruit sémantique non pertinent dans un processus qui exige des réactions à l'échelle de la milliseconde.
Le modèle VLA 2.0 élimine totalement ce goulot d'étranglement. Il adopte ce que l'entreprise appelle un chemin « Vision-Jeton Implicite-Action » , permettant une génération de commandes de conduite de bout en bout directement à partir des entrées visuelles brutes, sans aucune représentation langagière intermédiaire . Bien que le système puisse toujours accepter le langage comme une entrée — comme une commande de navigation ou une instruction vocale du conducteur — il ne crée plus jamais ses propres jetons de langage comme sortie interne pendant la conduite
. XPeng a présenté ce système à son stand du CVPR aux côtés d'un modèle du monde physique, et un article de recherche associé, DrivePTS, a été accepté pour publication à la conférence
.
La direction de XPeng n'a pas hésité à établir des comparaisons directes avec Tesla. Leurs déclarations au printemps et à l'été 2026 représentent une nette montée en confiance. Le Dr Liu a déclaré en juin que XPeng avait déjà atteint la parité avec la version 13 du FSD de Tesla en Chine et que rattraper les performances de la plus récente version 14 était « à portée de main d'ici la fin de l'été » .
Ces ambitions techniques sont appuyées par un engagement personnel peu commun de la part du dirigeant. En décembre 2025, le PDG He Xiaopeng a lancé un « pari de performance » public, déclarant que le système VLA de XPeng devait égaler l'expérience de conduite du FSD v14.2 de Tesla dans la Silicon Valley avant le 30 août 2026 . L'enjeu était explicite : en cas d'échec, le responsable de l'équipe « courrait nu »
.
Pour étayer son discours, XPeng a publié en mai 2026 une vidéo comparative mettant en scène deux passionnés de Tesla américains invités en Chine. Ce test en conditions réelles opposait une XPeng P7 dotée de VLA 2.0 à une Tesla Model 3 équipée du FSD sur des parcours identiques à Pékin. Selon le montage de XPeng, son véhicule n'a nécessité que 2 reprises en main par le conducteur, contre 7 pour la Tesla . Bien que He Xiaopeng ait réitéré à plusieurs reprises, notamment au salon Auto China 2026, que l'objectif est de dépasser totalement le FSD de Tesla sur le marché chinois d'ici le mois d'août, les observateurs indépendants appellent à une certaine prudence. Un journaliste d'Electrek ayant testé VLA 2.0 à Pékin a décrit sa performance comme « comparable » à celle du FSD v14, tout en notant que les deux systèmes exigent toujours une attention constante du conducteur et sont loin d'être totalement autonomes
.
Pour l'instant, la course reste une poursuite à grande vitesse, définie par des paris architecturaux audacieux et des déclarations encore plus ambitieuses. La décision de XPeng de concevoir le langage hors de son « cerveau » de conduite est un pari calculé : le chemin le plus rapide de la vision à l'action est une ligne droite, quitte à jeter le dictionnaire par la fenêtre.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
XPeng dépense 500 millions de dollars par an uniquement pour l'entraînement de ses modèles d'IA de conduite autonome, un budget distinct de son enveloppe R&D globale qui devrait presque doubler d'ici 2026.
XPeng dépense 500 millions de dollars par an uniquement pour l'entraînement de ses modèles d'IA de conduite autonome, un budget distinct de son enveloppe R&D globale qui devrait presque doubler d'ici 2026. Lors du CVPR 2026, la marque a dévoilé VLA 2.0, une architecture qui supprime toute étape de « traduction » en langage, son chef de l'IA estimant que « le langage est un poison » pour la performance en temps réel.
XPeng affirme avoir atteint la parité avec le FSD v13 de Tesla et vise à égaler la v14.2 d'ici fin août 2026, bien que des tests indépendants montrent que les deux systèmes exigent encore une attention constante du co...