小鹏确认每年仅用于AI模型训练的费用就高达5亿美元,且这只是算力成本,其2026年整体AI研发预算预计将接近10亿美元。 在CVPR 2026上,小鹏发布了全新的VLA 2.0架构,完全移除了驾驶过程中的语言中间环节。其AI负责人直言:“语言是毒药”。

Create a landscape editorial hero image for this Studio Global article: How much does Xpeng spend annually on AI model training for autonomous driving, what new VLA 2.0 architecture did it introduce at CVPR 2026. Article summary: Here are the answers to your three questions, based on recent reporting by Electrek and XPeng's official announcements.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 million) per month on AI training alone and believes it has already reac" source context "Xpeng spends $500M/year on AI training to beat Tesla FSD | Electrek" Reference image 2: visual subject "Xpeng’s head of autonomous driving told Electrek that the company is spending roughly 300 million RMB (~$41 millio
在一场愈演愈烈的技术和舆论战中,中国车企小鹏汽车公开了其挑战特斯拉自动驾驶霸主地位的蓝图。在2026年6月的计算机视觉与模式识别大会(CVPR)上,小鹏详细阐述了一种激进的AI架构,该架构抛弃了大多数机器人系统的核心组成部分——语言。结合其公开的惊人年度训练开支,小鹏正在证明,其下一代技术路线不仅与众不同,而且从根本上更快、更可靠。
小鹏的AI负责人、通用智能中心主管刘宪明博士在接受美国电动汽车媒体Electrek采访时透露,公司每月在AI模型训练上的花费约为3亿元人民币,折合年化5亿美元 。这个数字仅仅涵盖了训练自动驾驶模型的原始算力成本,不包括公司整体的AI研发预算。小鹏的AI相关总研发投入在2025年约为6.52亿美元,并预计在2026年随着野心的扩大攀升至约9.7亿美元
。
小鹏在CVPR 2026上的重头戏是正式介绍了其第二代视觉-语言-行动模型——VLA 2.0。该架构从根本上背离了许多AI系统(包括小鹏自己的第一代模型)处理驾驶任务的方式 。
在传统的VLA流程中,系统遵循一个顺序过程:汽车看见路况,将视觉感知转化为类语言的数据块(token),然后对这些语言数据块进行推理,最终生成驾驶动作。刘博士将这个中间步骤描述为关键弱点,并直言不讳地表示,“语言是毒药” 。他的论点是,在需要毫秒级反应的驾驶过程中,语言数据块会引入固有的延迟,并注入不相关的语义噪声。
VLA 2.0模型彻底消除了这个瓶颈。它采用了公司所称的**“视觉-隐式数据块-行动”** 路径,实现了从原始视觉输入直接端到端生成驾驶指令,中间没有任何语言表述环节 。虽然系统仍然可以接受语言作为输入——例如驾驶员的导航指令或语音命令——但在驾驶行为过程中,它绝不会将语言数据块作为内部输出自行生成
。小鹏在CVPR展台上展示了该系统,并搭配了一个实体AI世界模型,其相关研究论文《DrivePTS》也已被CVPR收录。
小鹏的领导层从不避讳与特斯拉进行直接比较。他们在2026年春夏之际的一系列表态,标志着其信心的急剧攀升。刘博士在6月的采访中表示,小鹏在中国市场上已经实现了对特斯拉FSD v13的追平,并且追平更新版FSD v14的性能“有望在夏天结束前实现” 。
这些技术主张背后,还有来自最高层的不同寻常的个人承诺。早在2025年12月,CEO何小鹏就立下了一个公开的“性能赌约”,宣称小鹏的VLA系统必须在2026年8月30日前,在中国路况下的体验达到特斯拉FSD v14.2在硅谷的水平 。赌注很明确:如果团队失败,负责人要“裸奔”
。
为了支撑这一叙事,小鹏在2026年5月发布了一段对比视频,邀请两位美国的特斯拉爱好者来到中国。这场精心安排的对比测试,让搭载VLA 2.0的小鹏P7与一辆搭载FSD的特斯拉Model 3在北京的相同路线上进行较量。根据小鹏剪辑的视频,其车辆仅需驾驶员接管2次,而特斯拉则需要7次 。尽管何小鹏在包括2026北京车展在内的多个场合重申,目标是在8月前在中国市场全面超越特斯拉FSD,但独立评测则提醒需保持谨慎。一位在北京测试过VLA 2.0的Electrek编辑评价其性能与FSD v14“相当”,但指出两套系统都仍需驾驶员时刻专注,远未达到完全自动驾驶的水平
。
眼下,这场竞赛仍是一场由大胆架构赌注和更激进口号所定义的高速追逐。小鹏决定从它的驾驶大脑中将语言剔除,是押注“从视觉到行动的最快路径是一条直线”——即便这意味着把字典扔出窗外。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
小鹏确认每年仅用于AI模型训练的费用就高达5亿美元,且这只是算力成本,其2026年整体AI研发预算预计将接近10亿美元。
小鹏确认每年仅用于AI模型训练的费用就高达5亿美元,且这只是算力成本,其2026年整体AI研发预算预计将接近10亿美元。 在CVPR 2026上,小鹏发布了全新的VLA 2.0架构,完全移除了驾驶过程中的语言中间环节。其AI负责人直言:“语言是毒药”。
小鹏声称其最新系统性能已追平特斯拉FSD v13,并将在2026年夏末达到FSD v14.2水平,但独立评测显示两套系统仍需驾驶员时刻专注。