8月27日,小鹏在广州办了场物理AI分享会,主题就一个字:时间。会上第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0版本将随小鹏G9L全球首发。
注意这个时间点。两天后,就是何小鹏和自家智驾负责人刘先明那场“赌约”的到期日——2025年12月,何小鹏体验完特斯拉FSD V14.2后立下约定:到2026年8月30日,小鹏VLA在国内的体验要赶上FSD在硅谷的水平。赶上了,他在硅谷开家中餐厅;没赶上,刘先明去金门大桥裸跑。
这个节骨眼上放出首次大升级,小鹏想讲的,绝不只是功能列表。
★以前的智驾是“看图”,现在要“看连续剧”
传统智驾模型的逻辑,本质是“认画面”:识别车、识别行人、识别红绿灯,把一帧帧画面认出来再下判断。但真实道路不是静止图片,是个连续变化的过程。前车为什么突然刹停?行人下一步往哪走?旁边那台车是要加塞还是让行?这些只看“当下这一帧”,永远看不出答案。
小鹏这次升级的核心,就是给模型补上“时间”这个维度。官方话术叫从3D空间理解走向4D时空理解,说人话就是:AI理解的维度,从“世界是什么样”,变成“世界正在发生什么、接下来可能发生什么”。
具体拆开是四件事——
记性变长了。第二代VLA引入Infini-VLA长时序架构,能记住前30秒的道路信息,连续事件不再被割裂成一帧帧孤立画面。前车踩刹车、行人变轨迹、路口博弈,都能串起来看。判断带着前因后果,而不是只看这一秒。
反应变快了。新的流式自回归推理,把“看→算→输出→再看”的离散循环,改成“边看、边想、边行动”的并行处理,端到端响应速度提升300%。落到场景里,就是前车急刹、行人折返、旁车强行加塞时,车能有老司机那种从容和预判。
会预测了。X-Foresight预测世界模型首次上车,能推演未来6秒内周边交通参与者可能的动作,再从中挑最优路线。配合Flow Matching技术,轨迹从“唯一解”变成“多种可能”——真实博弈本来就不止一个正确答案,多预测几种未来,才能选更好的行动。
切换更稳了。新加的MoT混合架构,按任务动态分配模型能力,城区、园区、泊车各找各的“专家”,减少场景切换时的任务干扰。
记过去、看现在、预测未来,加上端侧模型参数量扩大3.5倍、是主流VLA的15倍以上,这才凑成官方那句“综合安全能力提升20倍”。这套升级的本质,是把模型规模、推理速度和预测能力,一起抬上去了。
★比功能更值得注意的,是“整车大脑”
这次升级里,容易被功能党忽略的是Master Agent——小鹏首次推出的“整车统一大脑”。
过去车机是“听懂一句话”,Master Agent是“理解你想干什么”。你不用报精确地址,说“去望京那个三个尖尖的楼”“找个附近能充电的商场”,它能懂;一次说“带我回公司,顺路买咖啡、寄快递”,它自己拆成任务,调度智驾、底盘、座舱、车身这些垂直Agent协同执行。
还有两个功能得单独拎出来说:语音靠边停车、语音控制就近泊入。喊一嗓子,车在智驾状态下自己找位置完成靠边停车。这套能力的源头是Robotaxi——小鹏把部分L4级体验,直接下放给了量产车主。
★和特斯拉、华为比,这步棋的分量在哪
单看小鹏容易看不出深浅,放到对手旁边就清楚了。
对标特斯拉:路线同源,但这次打出了代际差异。特斯拉FSD走的是纯视觉+端到端,Robotaxi已经在得州奥斯汀全域跑起无安全员的商业化运营,内华达州也批了5000辆的部署额度,Cybercab预计9月发布、年底面向公众。论数据积累和北美先发,特斯拉仍然领先。但小鹏这波“理解时间”的升级,把记忆过去、预判未来做成了量产模型的原生能力,和FSD的“纯视觉端到端”在打法上已经不是同一个维度——一个在比谁的反应快,一个已经开始赌谁更懂物理世界。
对标华为:一个在“做更好的智驾”,一个在“造物理世界底座”。华为乾崑ADS现在是国内城区的领跑者,城区无图NOA覆盖400多城、月活用户超140万,2026年搭载量目标约300万辆,还把高阶能力一路下沉到15万级车型。论工程落地和规模覆盖,小鹏短期内追不上。但两者的战略定位差在根上:华为做的是更强的智驾系统,小鹏要做的是能跨本体复用的物理世界基座模型——同一套第二代VLA底座,既能开车,也能驱动Robotaxi和人形机器人。华为也有端到端,但当对手还在比“谁的城NOA开得多”时,小鹏已经把竞争的标尺,换成了“谁的模型更懂物理世界”。
这才是这次升级真正的行业坐标:智驾竞争,已经不在功能迭代这一层了。
★小鹏真正赌的,从来不是一次升级
把视线拉远,这盘棋比一次版本更新大得多。
8月24日,小鹏人形机器人完成首轮融资,超9亿美元、投后估值超63亿美元,刷新中国具身智能行业单轮私募融资纪录,IDG领投、高榕创投参投,腾讯、阿里两家战略投资者进场。同月,搭载第二代VLA的Robotaxi拿到广州远程测试资质,进入主驾无安全员的关键验证阶段,内测已完成超2000单。
这些事放在一起看,逻辑就通了:同一套物理世界基座模型,正在同时驱动汽车、Robotaxi、人形机器人——一个底座,多个产品。汽车只是物理AI第一个规模落地的本体,能力正在往更多本体迁移。
还有一条容易被忽略的:7月,小鹏在德国完成了第二代VLA的本地化验收测试。这套基于中国数据训练的模型,在几乎不增加本地化训练数据的情况下,欧洲城市道路的体验和国内高度接近,目标是明年上半年率先拿到欧洲监管许可。
这条信息的分量,比很多人想的重。中国和欧洲的道路结构、交通规则、驾驶习惯差异巨大,同一套模型能“少数据迁移”,才说明泛化能力真的成立——而跨地域泛化,恰恰是物理AI最难、也最值钱的部分。小鹏自己也说,出海不是把车卖出去,是把中国的AI能力带到全球真实道路上去验证。
当然,参数讲得再漂亮,最后都得在路上见真章。300%提速、20倍安全,这些数字留给车主去验证;9月图灵VLA 2.0 Lite也会开启推送,让更多老车主尝到这波升级。但小鹏这次至少把一件事说透了:智驾竞争的下一个分水岭,不是谁的功能多,而是谁的模型能真正理解并预测这个世界。两天后赌约到期,答案自然会揭晓一部分。
本文作者为踢车帮 刀哥