小鹏给车装了一颗「时间宝石」:记 30 秒、预判 6 秒,驾驶这件事到底发生在哪
发布于 2026-09-01
小鹏第二代 VLA 6.3.0 把智驾决策从「眼前这一帧」推到「过去 30 秒 + 未来 6 秒」的时间流,9 月起向 Ultra 车型推送,Lite 版下放至单图灵芯片 G9L Max。
小鹏给车装了一颗「时间宝石」:记 30 秒、预判 6 秒,驾驶这件事到底发生在哪
2026 年 8 月 27 日,小鹏开了场「物理 AI 分享会」,把第二代 VLA 模型的 6.3.0 版本端到端放出来。我盯这场发布会很久了,但这次有意思的不是参数又涨了多少,而是小鹏给了一个偏「奇异博士」的说法——这台车现在能往回看 30 秒、往前看 6 秒,「在时间里开车」。
把时间维度塞进智驾决策,这件事比参数扩张 3.5 倍值得说。
一、为什么"单帧识别"撑不起下一阶段智驾
过去几年的智驾,本质是「看清楚眼前这一帧」。不管是 BEV、占用网络还是 Transformer,目标都收敛在一件事:把当前传感器输入映射成「此刻的几何+语义」。
但人在开车的时候,从来不只用眼前这一帧。你会凭后视镜里前 5 秒的轨迹判断右后方车会不会挤进来,也会从前方岔路的电动车方向预判几秒后它会不会窜出。驾驶这件事,不只发生在路面上,也发生在时间里。
单帧方案的上限,就是「能识别不能推理」。小鹏这次把"过去—现在—未来"硬塞进同一个模型的输入端,等于把"推理"的物理位置从空间挪到了时间。
二、Infini-VLA:让模型不再"读一句忘一句"
新版本里负责"记住过去"的模块叫 Infini-VLA。名字来源于它的底层架构——支持更长的时序上下文,可以把更早的历史状态保留在推理路径上。量产版本把这个窗口定在 30 秒。
30 秒是什么概念?大约是城市道路一个完整信号灯周期的长度,也覆盖了一次并线—前车减速—后车跟车的整段博弈。小鹏在沟通会上放了一段演示:前车在路中掉头,车身刚露出一段空位时,测试车没有立刻加速钻过去,而是等对方完成整个掉头动作再起步。模型理解的是"前车正在掉头"这个持续行为,不是"眼前出现一段空隙"这一帧画面。
这跟人跟别人说话是同一种体验——你不会每听完一句就忘掉上一句。Infini-VLA 给车子装上的,就是这种"短期记忆"。
三、Streaming Inference:决策速度提升 300%
光有 30 秒记忆还不够。如果模型必须"先看完 30 秒再决策",那这 30 秒就是延迟——一辆以 60km/h 行驶的车,每秒走 16.7 米,等 1 秒可能就错过一次并线窗口。
所以这次另一个关键升级是 Streaming Inference「流式自回归推理」:模型可以边获取输入、边推理、边输出轨迹,不必等完整理解一段历史之后才开始动作。小鹏给出的数据是,决策速度相比上一代提升 300%。
这跟人开车更像了——眼睛看路、大脑判断、手脚操作同时进行。如果某段视野被前车遮挡,目标物从遮挡处窜出来,并行处理能少留一段"等推理完成的空白"。
四、X-Foresight:未来 6 秒的多种可能性
记得过去、着眼当下,最后还要展望未来。新版本里的 X-Foresight 模块负责推演未来 6 秒。它根据过去 30 秒累积的状态,计算出几种概率更高的后续状态分布,再用 Flow Matching 对这些可能的轨迹做拟合,挑出当下最合适的动作。
小鹏沟通会现场的视频里,一辆对向白车占据了逆向车道。模型要判断的是:对方在等?还是继续往前?还是会让出空间?看清对方在哪只是第一步,,才能决定自己这一步是缓行、绕行还是继续靠近。