“小鹏是一次性车企”,这句在车主圈流传了好几年的吐槽,最近十天遇到了最硬的一次回击。
8月11日,小鹏基础模型团队公开发表了一篇叫 XCoT-VLA 的论文。知乎紧接着何小鹏在 G9L 首秀上给了准话:基于双 Orin-X 芯片的第二代 VLA 蒸馏版调优效果超预期,今年四季度发布。微博两条消息前后脚砸下来,等了大半年的双 Orin 老车主,情绪终于有了着落。
不过这篇不是来喊"鹏厂牛逼"的。我想把三件事讲清楚:老车之前到底为什么跑不动第二代 VLA、XCoT 是用什么办法解决的、以及现在网上传的各种"推送时间表"里哪些是官宣、哪些只是爆料。看完你自己判断,是等,还是换。
老车为什么跑不动:不只是算力差4倍,是"思考方式"太啰嗦
先把硬件账摆出来。现在新款 Ultra 车型搭三颗图灵 AI 芯片,整车有效算力 2250TOPS;而当年的热门车——G6、G9 Max、X9、P7i Max——清一色双 Orin-X,508TOPS。微博差出去不止4倍。
但算力只是故事的一半。XCoT-VLA 这篇论文,把另一半更根本的瓶颈捅了出来:智驾模型的"思考方式"本身。
现在行业主流的 VLA 模型喜欢用大模型思维链(CoT)做推理——遇到红灯,AI 先在心里写一段小作文:"前方红灯亮起,前车正在减速,我距离停止线还有20米,当前车速50,需要缓慢刹车平稳停下……"这种自然语言推理一生成就是 40-80 个 Token,逐字解码,单个 Token 耗时 3.25ms,80 个 Token 光解码就要 260ms 以上。知乎
而车端规划的基准频率是 12Hz,一个规划周期只有 83.3ms。知乎论文在 H100 显卡上实测,长文本 CoT 推理耗时 279~307ms——严重超预算。微博这还是在 H100 上,换到 508TOPS 的老车芯片上,矛盾只会更尖锐。
所以老车跑不动第二代 VLA,不完全是"脑子小",更是"想得太慢"。

XCoT 的解法:把小作文压缩成几个"驾驶指令词"
XCoT 的思路很直接:让 AI 戒掉废话。砍掉所有冗余的场景描述和推理过程,只保留能直接控制车辆的动作指令。

具体做法是设计了一套"可执行语义 Token",每次推理只用 2-6 个,全部来自一个固定词典:比如 DECELERATE(减速)、RED_LIGHT_HOLD(红灯停车)、LEFT_TURN_PREPARE(准备左转)、NAV_LEFT_LANE_CHANGE(向左变道)、HAZARD_YIELD(避让危险)。知乎
遇到"左转遇红灯",AI 的全部思考就是一串:LEFT_TURN_PREPARE → DECELERATE → RED_LIGHT_HOLD,3 个 Token 完事。知乎
效果立竿见影:论文实测,长文本推理要 279~307ms,XCoT 只要 38.6~66.3ms,被压进了 83.3ms 的实时预算之内。微博
更让老车主欣慰的是,提速没有拿精度换。论文的开环轨迹评测里,对比"无推理"基线,XCoT 的通用路况纵向误差(ADE)从 1.6452 降到 1.3233,变道场景横向终点误差(FDE)从 1.6160 降到 0.6484,砍了一半还多。微博翻译成人话:想得少、反应快,变道这种关键场景反而规划得更准。

架构上也留了后手:XCoT 把网络拆成推理(Reason)和控制(Control)两条独立分支,以后单独优化推理策略时,不会把已经训好的控制能力搞乱——老车后续持续 OTA,理论上有空间。知乎
当然,论文边界也要说清楚:目前的成绩都是开环评测,也就是在历史数据上"做题",不是实车上路闭环跑出来的;时延数据是在 H100 上测的,落到车端 Orin 芯片还有多少余量,要等实车验证;论文自己也承认,交互博弈、感知容错、闭环策略优化还没解决。知乎论文是论文,量产是量产,这条线得划清楚。
时间线对账:哪些是官宣,哪些是爆料
这几个月信息特别乱,我按时间捋一遍:
2025年11月:小鹏承诺,2026年一季度 Ultra 车型全量推送第二代 VLA,Max 车型 2026 年内全量适配——"科技平权"这个说法就是从这来的。微博
2026年3月2日:第二代 VLA 正式发布,推送分三批:第一批 3 月下旬起是新 Ultra 车型,第二批 4 月下旬是 2026 款其他新车,第三批是老车主 Max 车型,推"蒸馏版",时间待定。微博
3月16日:何小鹏直播确认 3 月 19 日起逐步推送,先推 P7 Ultra。微博同一天车主群里流传一个段子:“好消息,真能提问,提问真能回答;坏消息,回答了你不爱听的”——因为双 Orin Max 要比单图灵 Max 推得晚。微博
8月11日:XCoT-VLA 论文公开,同一天官宣第二代 VLA 迎来 6.3.0 大版本升级。微博
8月11-12日:何小鹏在 G9L 首秀及后续官宣中给出两个时间点——单图灵芯片蒸馏版,8月底9月初发布;双 Orin-X 蒸馏版,效果超预期,四季度发布。
8月20日:小鹏官宣图灵第二代 VLA 走向全球,何小鹏放话 XPENG NGP 是"中国排名第一的智驾系统"。哔哩哔哩

然后重点区分两条正在流传的消息:
第一条,“NGP V6.3.0.8901 内测版已支持 Max 版 VLA 2.0 蒸馏版”——这是路边消息,官方没确认。微博
第二条,有博主判断"10月推送"——这是个人推测。
只有"双 Orin-X 蒸馏版,四季度",是何小鹏在台面上说的。四季度意味着 10 月到 12 月,10 月只是最早的可能,不是承诺。
双Orin车主,等还是换?三个判断
如果你的车是 G6 Max、G9 Max、X9 或 P7i Max,我的建议是:
第一,别为爆料换车。卖车换车要承担折旧、保险、置换成本,动辄几万块。在官方时间表已经明确到季度的情况下,为一个"10月"的传闻提前动作,性价比太低。最差的情况,也就是再等两三个月。
第二,给蒸馏版管理好预期。蒸馏版不等于满血版,官方口径是"剪枝适配"——508TOPS 的硬件上限摆在那,城市智驾体验的上限注定低于 2250TOPS 的 Ultra。VLA 2.0 是世代级的架构变化,幽灵刹车、汇入口保守不变道这些老版本的槽点大概率会明显改善,但蒸馏之后还剩几成功力,要等实测说话。
第三,盯几个比传闻靠谱的信号:一是 8 月底单图灵蒸馏版发布时的官方口径——它是蒸馏路线的先行验证,落地顺利,双 Orin 版只会更快;二是后续 OTA 公告里,Max 车型的配置说明中是否出现"VLA"字样;三是官方推送批次和车型白名单。这三个信号逐个兑现,Q4 就值得等。
至于已经换了图灵版的车主,有人说过"突然有点后悔换了图灵哈哈哈哈"——倒也不必,图灵版算力上限更高,这波不亏。微博
最后多说一句
这次小鹏其实回答了一个全行业都在回避的问题:智驾能力到底跟车走多久?
有的厂商答案是"跟新车走"。小鹏这次至少给出了另一个答案:把"思考"从 80 个 Token 压到 6 个,把第二代 VLA 塞进 508TOPS 的老车。论文在那,官宣在那,剩下的就是 Q4 的推送。
"一次性鹏友"这个标签能不能彻底撕掉,到时候见分晓。