XPeng avslöjar en årlig kostnad på 500 miljoner dollar enbart för att träna AI modeller för självkörning – summan täcker bara datorkraften, medan den totala AI budgeten nästan fördubblas till 2026. Vid AI konferensen CVPR 2026 visade XPeng upp sin nya VLA 2.0 arkitektur som helt tar bort mellansteget med språktokens.

Create a landscape editorial hero image for this Studio Global article: How much does Xpeng spend annually on AI model training for autonomous driving, what new VLA 2.0 architecture did it introduce at CVPR 2026. Article summary: Here are the answers to your three questions, based on recent reporting by Electrek and XPeng's official announcements.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 million) per month on AI training alone and believes it has already reac" source context "Xpeng spends $500M/year on AI training to beat Tesla FSD | Electrek" Reference image 2: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 millio
I kampen om självkörande bilars framtid har kinesiska XPeng skruvat upp tonläget rejält. Under AI-konferensen CVPR i juni 2026 presenterade företaget en nydanande arkitektur som kastar ut en hittills självklar komponent ur de flesta robottänkande system – språket. Samtidigt avslöjade XPeng för första gången exakt hur mycket pengar som bränns på att träna bilarnas hjärnor. En siffra som får det att svindla.
I en intervju med Electrek berättade Dr. Xianming Liu, chef för XPengs General Intelligence Center, att företaget lägger ungefär 300 miljoner RMB – motsvarande 41 miljoner dollar – i månaden enbart på att träna AI-modeller för självkörning. På årsbasis landar den summan på runt en halv miljard dollar . Och då pratar vi bara om rå datorkraft, inte hela forsknings- och utvecklingsbudgeten. Den totala AI-relaterade FoU-kostnaden låg 2025 på omkring 652 miljoner dollar och väntas klättra till nästan 970 miljoner dollar under 2026
. Det är en massiv satsning från ett företag som många analytiker redan börjat kalla ”nästa Tesla”
.
Hjärtat i XPengs CVPR-presentation var den andra generationen av deras Vision-Language-Action-modell, kallad VLA 2.0. För att förstå nyheten måste vi först titta på hur den första generationen fungerade. Tänk dig att bilen ser vägen, översätter det den ser till språkliknande symboler – ungefär som ord eller meningar – och sedan funderar över dessa ”språktokens” för att bestämma hur den ska köra. Det är en process i flera steg: se, översätt till språk, resonera, agera .
Dr. Liu menar att just det mellansteget är en kritisk svaghet. Han uttryckte det rakt på sak i intervjun: ”Språk är gift” för körning i realtid . Hans argument är att språktokens skapar en inbyggd fördröjning och dessutom fyller systemet med irrelevant semantiskt brus. När en bil måste reagera på millisekunder för att undvika en olycka är det inte optimalt att först översätta verkligheten till vackra beskrivningar.
Den nya VLA 2.0-modellen stryker det här steget helt. XPeng kallar det för en ”Vision-Implicit Token-Action”-bana – i praktiken en direkt väg från ögats råa visuella signaler till bilens handlingar, utan någon språklig mellanlandning . Systemet kan fortfarande ta emot språkliga kommandon, som en förares röststyrning eller textinstruktion, men det skapar aldrig själv språktokens som ett internt mellansteg under själva körningen
. På konferensen visades VLA 2.0 upp tillsammans med en fysisk AI-världsmodell, och en forskningsartikel vid namn DrivePTS accepterades för publicering vid CVPR
.
XPengs ledning har inte varit blygsamma i sina jämförelser med Tesla. Under våren och sommaren 2026 har självförtroendet trappats upp markant. Dr. Liu hävdade i sin juni-intervju att XPeng redan har nått samma prestandanivå som Teslas FSD v13 i Kina, och att det är ”inom räckhåll att matcha även den nyare FSD v14 före sensommaren” .
Den tekniska målsättningen backas upp av ett minst sagt personligt åtagande från toppen. I december 2025 gick XPengs vd He Xiaopeng ut med en offentlig ”prestationsvadslagning”. Han deklarerade att företagets VLA-system senast den 30 augusti 2026 måste ge samma körupplevelse på kinesiska vägar som Teslas FSD v14.2 ger i Silicon Valley . Insatsen var tydligt preciserad: om teamet misslyckas ska den ansvarige personen ”springa naken”
. Ett drastiskt löfte som onekligen väckt uppmärksamhet internationellt.
För att underbygga sina påståenden släppte XPeng i maj 2026 en iscensatt video där två Tesla-entusiaster från USA flögs till Peking. En XPeng P7 med VLA 2.0 ställdes mot en Tesla Model 3 med FSD på identiska rutter. Enligt XPengs egen videoredigering krävde deras bil endast två föraringripanden, medan Teslan behövde sju .
He Xiaopeng har upprepat målet vid flera tillfällen, bland annat på bilmässan Auto China 2026, där han sade att ambitionen är att ”fullständigt överträffa Teslas FSD på den kinesiska marknaden före augusti” . Oberoende bedömare manar dock till viss återhållsamhet. En Electrek-redaktör som testade VLA 2.0 i Peking beskrev prestandan som ”jämförbar” med Teslas FSD v14, men poängterade samtidigt att båda systemen fortfarande kräver konstant uppsikt från föraren och är långt ifrån helt autonoma
.
Tävlingen om självkörningens framtid är långt ifrån avgjord. XPengs beslut att arkitektoniskt designa bort språket ur bilens körhjärna är en kalkylerad chansning – ett ställningstagande för att den snabbaste vägen från synintryck till handling är en rak linje. Även om det innebär att man slänger ordboken ut genom fönstret.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
XPeng avslöjar en årlig kostnad på 500 miljoner dollar enbart för att träna AI modeller för självkörning – summan täcker bara datorkraften, medan den totala AI budgeten nästan fördubblas till 2026.
XPeng avslöjar en årlig kostnad på 500 miljoner dollar enbart för att träna AI modeller för självkörning – summan täcker bara datorkraften, medan den totala AI budgeten nästan fördubblas till 2026. Vid AI konferensen CVPR 2026 visade XPeng upp sin nya VLA 2.0 arkitektur som helt tar bort mellansteget med språktokens.
Företaget hävdar att man redan nått samma nivå som Teslas FSD v13, och siktar på att matcha den nyare FSD v14.2 i augusti – men oberoende tester visar att båda systemen fortfarande kräver konstant föraruppsikt.