8月27日,小鹏集团在广州举办了一场以"TIME 时间"为主题的物理AI分享活动,第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0版本将随小鹏G9L全球首发。
这次升级最核心的变化,是把"时间"真正纳入了模型。过去,自动驾驶模型理解的是一个静态的3D空间——能识别出车、人、道路和信号灯,但看到的是"当下这一刻"。而现在,小鹏要让它理解的是一个不断变化的4D时空。
怎么理解这个差异?就拿开车来说,一个合格的老司机,不会只看眼前这一秒,他会记得刚才发生了什么,也会预判接下来几秒可能发生什么。小鹏这次就是想让AI司机也具备这种"时间感"。
为了实现这一点,第二代VLA引入了Infini-VLA长时序架构,让模型能够记住前30秒的世界。以前连续发生的道路事件会被割裂成一帧帧独立画面,现在则能串联起来,形成完整的时序理解,决策时拥有更长的上下文。
光"记得住"还不够,还得"反应快"。第二代VLA采用流式自回归推理,从离散推理走向连续推理,端到端响应速度提升了300%。过去模型是"看→算→输出→再看"的循环,现在能做到"边看、边想、边行动"并行处理。遇到前车突然刹停、行人临时折返、旁车强行加塞这类突发情况,车辆的应对会更像经验丰富的老司机。
更进一步,小鹏的X-Foresight预测世界模型也首次上车,能够预判未来6秒内的道路变化,推演周边交通参与者可能的走向。记住过去、理解现在、预判未来——这是小鹏对"AI理解时间"给出的完整答案。
能力跃迁的背后是模型规模的升级。第二代VLA全新版本端侧模型参数量提升了3.5倍,是主流VLA模型的15倍以上,叠加超前轨迹预判、超长有效时序和更快的决策响应,综合安全能力提升了20倍。新版还引入了MoT混合架构,针对城区道路、园区、泊车等不同场景动态分配模型能力,让不同驾驶任务之间切换更稳定。
除了智能驾驶,这次升级还做了一件更有意思的事——小鹏用做机器人的方式重构了车机大脑,首次推出Master Agent,实现了VLA与VLM的驾舱融合。它能理解自然语言甚至模糊语义,把用户的意图自动拆解成任务,再调度智驾、底盘、座舱、车身等各个垂直Agent协同执行。
换句话说,车辆不再只是"听懂一句话",而是开始"理解你真正想完成什么",整车第一次拥有了一个统一的"大脑"。配合新上线的"语音靠边停车""语音控制就近泊入"等功能,小鹏Robotaxi的L4级能力正通过同源技术逐步下放到量产车型。
这套物理AI能力,小鹏并不打算只用在汽车上。基于统一技术底座,第二代VLA已实现L2至L4能力贯通,搭载它的Robotaxi近日获批广州市智能网联汽车远程测试资质,可开展主驾无安全员道路测试。同一套基座模型也落地到了人形机器人IRON上——它搭载3颗图灵AI芯片,有效算力达2250 TOPS,已实现端侧部署,无需远程遥操作即可自主完成复杂任务。
产业化的步伐也在加快。8月24日,小鹏机器人业务完成首轮股权融资,融资超9亿美元、投后估值超63亿美元,刷新了中国具身智能行业单轮私募股权融资纪录,由IDG资本领投、高榕创投参投,腾讯和阿里巴巴作为战略投资者入局。全球化方面,小鹏已在德国完成第二代VLA的本地化验收测试,目标明年上半年率先在欧洲获得监管许可并陆续交付。
支撑这一切长期演进的,是小鹏持续耕耘的AI Infra。依托百万车队和十亿级数据资产,小鹏构建了数据飞轮,模型单次训练数据吞吐量已达1亿clips,比半年前增长10倍。
同时通过学习式Token压缩与蒸馏训练,小鹏把基座模型的能力部署到了算力更低的平台,蒸馏后的图灵VLA 2.0 Lite预计9月开启首批推送,让小鹏G9L Max车主率先体验——让高阶智能驾驶覆盖更多车型和用户。
从理解空间到理解时间,这一步看起来只是模型的维度变化,背后却是小鹏把自动驾驶、机器人和飞行汽车统一到同一套物理AI底座上的长期布局。模型会不断迭代,但真正形成壁垒的,是持续迭代模型的能力本身。
如果您还有其他想要了解请评论区留言。丁丁哥将会持续跟进,第一时间为您分享精彩内容。