XPeng potwierdził, że wydaje 500 mln dolarów rocznie na samo szkolenie modeli AI do jazdy autonomicznej, nie licząc szerszego budżetu R&D, który w 2026 roku ma sięgnąć ok. Na konferencji CVPR 2026 firma zaprezentowała VLA 2.0 – architekturę, która całkowicie usuwa pośrednie tokeny językowe z procesu prowadzenia auta.

Create a landscape editorial hero image for this Studio Global article: How much does Xpeng spend annually on AI model training for autonomous driving, what new VLA 2.0 architecture did it introduce at CVPR 2026. Article summary: Here are the answers to your three questions, based on recent reporting by Electrek and XPeng's official announcements.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 million) per month on AI training alone and believes it has already reac" source context "Xpeng spends $500M/year on AI training to beat Tesla FSD | Electrek" Reference image 2: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 millio
W trwającym pojedynku gigantów motoryzacji chiński XPeng nie przebiera w słowach. Podczas konferencji CVPR w czerwcu 2026 roku firma uchyliła rąbka tajemnicy na temat swojej najnowszej broni w wyścigu o autonomiczną jazdę. Kluczowy wniosek? Czasem mniej znaczy więcej – zwłaszcza gdy chodzi o język. XPeng szczegółowo opisał architekturę AI nowej generacji, która radykalnie odchodzi od dotychczasowych standardów.
Szef działu AI w XPeng, dr Xianming Liu, w rozmowie z Electrek podał konkretną kwotę: firma wydaje około 300 milionów juanów miesięcznie, czyli około 500 milionów dolarów rocznie, wyłącznie na moc obliczeniową do trenowania modeli AI odpowiedzialnych za autonomiczną jazdę . To osobny budżet, nieobejmujący całkowitych wydatków na badania i rozwój, które w 2025 roku wyniosły 652 miliony dolarów, a w 2026 mają wzrosnąć do oszałamiających 970 milionów dolarów
.
Sercem prezentacji XPenga na targach CVPR 2026 było oficjalne pokazanie drugiej generacji modelu Vision-Language-Action, czyli VLA 2.0. To nie ewolucja, a rewolucja w myśleniu o tym, jak auto ma podejmować decyzje na drodze .
Wyobraźmy sobie tradycyjny system: auto patrzy na drogę, następnie to, co widzi, tłumaczy na język (tokeny), po czym analizuje to „zdanie” i dopiero wtedy wykonuje manewr. Brzmi jak strata cennych milisekund, prawda? Doktor Liu nie owija w bawełnę, nazywając ten etap „trucizną”. Jego zdaniem „język to trucizna” (language is poison) dla jazdy w czasie rzeczywistym . Przetwarzanie językowe wprowadza niepotrzebne opóźnienia i szum informacyjny, który w ułamku sekundy może zadecydować o bezpieczeństwie.
Co więc proponuje XPeng? Model VLA 2.0 idzie na skróty. Wykorzystuje autorską ścieżkę „Vision-Implicit Token-Action”, która pozwala generować polecenia jazdy bezpośrednio z surowych danych wizualnych, z całkowitym pominięciem etapu pośredniej reprezentacji językowej . System wciąż oczywiście rozumie polecenia głosowe kierowcy, ale sam nie tworzy już w swojej „głowie” żadnych językowych opisów sytuacji na drodze. Mówiąc wprost: widzi i działa
.
Ambicje XPenga najlepiej obrazuje osobisty zakład. W grudniu 2025 roku prezes He Xiaopeng publicznie zobowiązał się, że system VLA XPenga dorówna doświadczeniom z jazdy Tesli FSD v14.2 w Dolinie Krzemowej do 30 sierpnia 2026 roku. Stawka była wysoka i dość osobliwa: jeśli zespół poniesie porażkę, osoba odpowiedzialna za projekt „pobiegnie nago” .
Od tego czasu firma tylko eskalowała swoje deklaracje. W czerwcu 2026 roku dr Liu ogłosił, że XPeng osiągnął już poziom Tesli FSD v13 na chińskich drogach. Co więcej, dorównanie nowszemu oprogramowaniu FSD v14 jest „w zasięgu ręki przed końcem lata” .
Aby uwiarygodnić te śmiałe tezy, w maju 2026 roku XPeng zaprosił do Chin dwóch amerykańskich entuzjastów Tesli i zorganizował bezpośrednie porównanie na ulicach Pekinu. Naprzeciwko siebie stanęły XPeng P7 z systemem VLA 2.0 oraz Tesla Model 3 z FSD. Według opublikowanego przez XPenga nagrania, jego auto wymagało interwencji kierowcy tylko 2 razy, podczas gdy Tesla potrzebowała jej aż 7.
Czy to oznacza koniec dominacji Tesli? Nie do końca. Redaktor Electrek, który testował VLA 2.0 w Pekinie, opisał jego działanie jako „porównywalne” do FSD v14, ale ze znaczącym zastrzeżeniem: oba systemy wciąż wymagają nieustannej uwagi kierowcy i nie są w pełni autonomiczne . Wyścig trwa, a stawka jest najwyższa w historii. XPeng postawił wszystko na jedną kartę – odrzucenie języka jako zbędnego balastu – i wierzy, że najkrótsza droga od percepcji do działania wiedzie po linii prostej.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
XPeng potwierdził, że wydaje 500 mln dolarów rocznie na samo szkolenie modeli AI do jazdy autonomicznej, nie licząc szerszego budżetu R&D, który w 2026 roku ma sięgnąć ok.
XPeng potwierdził, że wydaje 500 mln dolarów rocznie na samo szkolenie modeli AI do jazdy autonomicznej, nie licząc szerszego budżetu R&D, który w 2026 roku ma sięgnąć ok. Na konferencji CVPR 2026 firma zaprezentowała VLA 2.0 – architekturę, która całkowicie usuwa pośrednie tokeny językowe z procesu prowadzenia auta.
Szef AI XPenga stwierdził, że "język to trucizna" dla autonomicznej jazdy, a nowy model osiągnął już poziom Tesli FSD v13, a wkrótce ma dorównać FSD v14.2.