云霞资讯网

今天小鹏第二代VLA迎来第一次重大升级。过去很多智驾模型解决的是空间问题: 车在哪、人在什么位置、道路怎么走。但真实驾驶并不是一张静止图片。 比如一辆车在你旁边连续几次向车道线靠近,一个行人在路边犹豫后突然转身,一辆前车先轻点刹车再急刹——单看某一帧可能都不危险,真正影响判断的是过 ​

今天小鹏第二代VLA迎来第一次重大升级。过去很多智驾模型解决的是空间问题:

车在哪、人在什么位置、道路怎么走。但真实驾驶并不是一张静止图片。

比如一辆车在你旁边连续几次向车道线靠近,一个行人在路边犹豫后突然转身,一辆前车先轻点刹车再急刹——单看某一帧可能都不危险,真正影响判断的是过去发生了什么,以及接下来可能发生什么。

这次第二代VLA的变化,恰好集中在这里。

Infini-VLA长时序架构可以记住前30秒的世界;X-Foresight预测世界模型向前推演6秒;

Streaming Inference把传统看→算→输出的离散过程变成边看、边想、边行动,端到端响应速度提升300%。

30秒过去+实时现在+6秒未来,拼起来才是这次所谓的4D时空理解。

这也解释了为什么模型参数量扩大3.5倍。更长的上下文、更复杂的运动关系和更多未来可能性,都需要更大的模型容量。

按照小鹏公布的数据,新版端侧模型参数量已经达到主流VLA的15倍以上,多维综合安全能力提升20倍。

当然,参数和倍数最终还是要回到真实道路验证。对普通用户而言,我反而更关注它能不能处理好那些很难写进规则里的连续事件:

加塞前的试探、行人意图变化、前车异常减速、复杂博弈等等。如果这些场景的判断明显变得更早、更连贯,所谓理解时间才真正有意义。

另一个容易被忽略的变化,是Master Agent。

小鹏把VLA和VLM进一步打通,让智驾、座舱、底盘、车身控制开始由统一Agent调度。

语音靠边停车、语音控制就近泊入,其实已经能看到这种思路:人表达目的,AI自己拆解任务,再调用车辆不同系统完成。

汽车正在从执行命令,慢慢走向理解意图。

再往后看,这次升级其实和小鹏最近的机器人动作能够串起来。

第二代VLA已经贯通L2到L4,同源技术进入Robotaxi;IRON则搭载3颗图灵AI芯片、2250TOPS算力,物理世界基座模型直接端侧部署。

在8月24日,小鹏机器人业务又完成超9亿美元融资,投后估值超63亿美元。

所以现在再看小鹏反复讲的物理AI,脉络越来越清楚:汽车是最大的数据入口和第一个规模化训练场,Robotaxi验证更高阶能力,机器人把模型迁移到新的本体。

真正值得长期观察的,也因此不只是某一版VLA有多强,而是它背后的AI Infra。

百万车队、十亿级数据资产、单次训练1亿clips,半年数据吞吐量增长10倍,再加上训练、仿真、评估和部署体系,这些东西决定了模型能不能一轮接一轮继续进化。

全新版本将由小鹏G9L首发,Lite蒸馏版9月开始推送,欧洲则计划明年上半年争取监管许可。

如果说过去几年智驾竞争主要是在解决车能不能看懂空间,那么下一阶段的问题可能已经变成:

AI能不能记住过去、理解现在,并提前思考未来。

期待新版软件上车后的表现。

小鹏第二代VLA全新版本9月开启推送小鹏第二代VLA蒸馏版9月开启首批推送小鹏G9LMax版首发第二代VLA蒸馏版