小鵬證實每年花費高達5億美元於自駕AI模型訓練,僅為運算成本;其更廣泛的AI研發預算預計在2026年將躍升至近9.7億美元。 在CVPR 2026上,小鵬推出第二代視覺語言行動模型 (VLA 2.0),徹底移除了駕駛流程中的語言標記。AI主管劉顯明直言:「語言是毒藥」,是為了達到即時反應效能的關鍵決策。

Create a landscape editorial hero image for this Studio Global article: How much does Xpeng spend annually on AI model training for autonomous driving, what new VLA 2.0 architecture did it introduce at CVPR 2026. Article summary: Here are the answers to your three questions, based on recent reporting by Electrek and XPeng's official announcements.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 million) per month on AI training alone and believes it has already reac" source context "Xpeng spends $500M/year on AI training to beat Tesla FSD | Electrek" Reference image 2: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 millio
在一場日漸白熱化的技術與言論交鋒中,中國汽車製造商小鵬(XPeng)公開了其挑戰特斯拉自動駕駛主導地位的藍圖。在2026年6月的電腦視覺與模式辨識大會(CVPR)上,該公司詳細闡述了一種激進的AI架構,其核心在於拋棄多數機器人系統的關鍵組件——語言。伴隨著驚人的年度訓練支出曝光,小鵬正試圖證明,他們的次世代方案不僅與眾不同,在根本上更快速、更可靠。
小鵬通用智慧中心負責人、AI主管劉顯明博士在接受《Electrek》專訪時透露,公司每月投入約人民幣3億元,折合每年約5億美元(約新台幣160億元),僅用於AI模型的訓練 。這筆數字僅涵蓋了訓練自駕模型的原始運算成本,並不包括公司總體的AI研發預算。小鵬在2025年用於AI相關的研發支出約為6.52億美元,而隨著其野心的擴張,此數字預計在2026年將攀升至約9.7億美元
。
小鵬在CVPR 2026上的重頭戲,是正式發表其第二代視覺語言行動模型(Vision-Language-Action model),即VLA 2.0。此架構從根本上偏離了許多AI系統——包含小鵬自家的第一代模型——處理駕駛任務的方式 。
在傳統的VLA流程中,系統遵循著一套循序漸進的過程:車輛「看見」路況,將視覺感知轉換成類似語言的標記(tokens),然後針對這些語言標記進行推理,最終產生駕駛行為。劉博士將這個中介步驟形容為一個致命的弱點,他直言不諱地表示,對即時駕駛來說,「語言是毒藥」 。他的論點是,語言標記會帶來固有的延遲,並在需要毫秒級反應的過程中注入不相關的語義雜訊。
VLA 2.0模型徹底消除了這個瓶頸。它採用了公司所稱的**「視覺-隱含標記-行動」(Vision-Implicit Token-Action)**路徑,能夠直接從原始視覺輸入端到端地生成駕駛指令,過程中完全沒有任何中介的語言表徵 。儘管系統仍可接受語言作為「輸入」——例如駕駛的導航指令或語音命令——但在實際駕駛的行為生成過程中,它絕不會自行創造語言標記作為內部輸出
。小鵬在CVPR的攤位上展示了該系統以及一個實體的AI世界模型,其相關研究論文《DrivePTS》也已獲大會接受發表
。
小鵬的領導層在與特斯拉的正面交鋒上毫不客氣。他們在2026年春夏之際的一系列聲明,顯示出其自信的急遽升溫。劉博士在6月的訪談中表示,小鵬在中國已達到與特斯拉FSD v13並駕齊驅的水準,而追平更新版FSD v14的效能則是「在夏末之前可望實現」的目標 。
這些技術主張背後,還有來自最高層非比尋常的個人承諾。2025年12月,執行長何小鵬設立了一個公開的「效能賭注」,宣告小鵬的VLA系統必須在2026年8月30日前,達到特斯拉FSD v14.2在美國矽谷的道路體驗水準 。這個賭注的代價非常明確:若團隊失敗,負責人就要「裸奔」
。
為了支持其論述,小鵬在2026年5月發布了一支一對一實測影片,將兩名美國特斯拉愛好者請到中國。這場精心安排的對比,讓一輛搭載VLA 2.0的小鵬P7與一輛配備FSD的特斯拉Model 3,在相同的北京市區路線上進行比拼。根據小鵬剪輯的影片,其車輛僅需2次駕駛接手,而特斯拉則高達7次 。儘管何小鵬多次在包含2026年北京車展的場合重申,目標是在8月前於中國市場全面超越特斯拉FSD,但獨立評測仍呼籲外界保持謹慎。《Electrek》的一位編輯在北京測試VLA 2.0後,形容其表現與FSD v14「相當」,但也指出兩套系統依然需要駕駛隨時保持專注,距離全自動駕駛還有很長一段路要走
。
目前看來,這場競賽仍是一場由大膽的架構賭注與更為大膽的主張所定義的高速追逐。小鵬決定在設計環節就將語言從其駕駛大腦中剔除,是一場精心計算的豪賭;他們相信,從視覺到行動的最快路徑就是一條直線——即便這意味著要把整本字典扔出窗外。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
小鵬證實每年花費高達5億美元於自駕AI模型訓練,僅為運算成本;其更廣泛的AI研發預算預計在2026年將躍升至近9.7億美元。
小鵬證實每年花費高達5億美元於自駕AI模型訓練,僅為運算成本;其更廣泛的AI研發預算預計在2026年將躍升至近9.7億美元。 在CVPR 2026上,小鵬推出第二代視覺語言行動模型 (VLA 2.0),徹底移除了駕駛流程中的語言標記。AI主管劉顯明直言:「語言是毒藥」,是為了達到即時反應效能的關鍵決策。
小鵬宣稱其系統已與特斯拉FSD v13並駕齊驅,並有信心在2026年夏末追平FSD v14.2,但獨立測試顯示,兩套系統仍需要駕駛隨時保持專注。