8月27日,小鹏集团举办物理AI分享暨第二代VLA全新版本体验日活动。南都·湾财社记者现场获悉,小鹏第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0版本将于小鹏G9L全球首发。
此次模型升级的核心,是让AI开始真正理解时间:从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。简单来说,要真正完成复杂的物理世界决策,仅仅“看见”还远远不够,车辆需要知道过去、现在发生了什么,以及未来可能发生什么。
据介绍,在“过去”这一时间维度,第二代VLA全新引入Infini-VLA长时序架构,能记得前30秒的世界,这样的意义在于,驾驶判断开始拥有更长的上下文,更多有效信息进入模型。此后,连续发生的道路事件不再被割裂成一个个独立画面,模型可以将此前发生的动作、位置和场景串联起来,形成更加完整的时序理解。
在“现在”这一维度最重要的是决策速度。道路情况时刻变化、模型也要边看边想,决策速度需跟上现实变化。为此,第二代VLA同步提升了模型推理效率,采用Streaming Inference(流式自回归推理),从离散推理走向连续推理,端到端响应速度提升300%。面对不断变化的道路状况,传统的模型是“看→算→输出→再看”的模式,而第二代VLA能够做到“边看、边想、边行动”的并行处理。
在“未来”这一维度,预测更多种未来,才能做出更好的行动。在真实道路上,前车可能突然刹停,行人可能临时改变方向,旁车可能突然加塞,模型不仅要识别过往画面和当前画面信息,还需要根据目标物的位置、速度、运动趋势、道路环境等进行预测。为此,小鹏X-Foresight预测世界模型首次上车,可预判6秒内发生什么,推演周边交通参与者未来的可能行为。
与此同时,新版模型引入MoT混合架构,通过针对不同任务动态分配模型能力,减少城区道路、园区、泊车等不同场景之间的任务干扰,把不同的问题交给不同的“专家”,让模型在不同驾驶任务之间更加稳定地切换。
“为什么我们需要一个更大的模型?”小鹏集团通用智能中心负责人刘先明表示,更大的参数量才能实现足够强的泛化能力,让快速进入全球市场成为可能。小鹏第二代VLA全新版本端侧模型参数量提升3.5倍,是主流VLA的15倍以上,结合超前轨迹预判、超长有效时序、更快决策响应,使得多维综合安全能力提升20倍。
值得一提的是,第二代VLA全新版本升级的不只是智能辅助驾驶,小鹏选择用做机器人的方式重构车机大脑,首次推出Master Agent,实现VLA与VLM的驾舱融合,让车辆从“听懂一句话”进一步走向“理解用户真正想完成什么”。Master Agent建立在小鹏自研Omni全模态模型之上,不仅能够理解自然语言和模糊语义,还能将用户意图自动拆解为任务,并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,实现从“理解”到“行动”的闭环。这意味着,Master Agent让整车第一次拥有了一个统一大脑,也让车辆智能从响应单一指令,进一步迈向自主理解意图、规划任务和协同执行。
本次全新版本升级还带来了“语音靠边停车”、“语音控制就近泊入”功能,用户只需通过语音下达停车指令,车辆即可在智驾状态下自主寻找合适位置并完成靠边停车,实现从“语音指令”到“自主执行”的完整闭环。
采写:南都·湾财社记者 陈镜安