Loading...
Loading...
Published on 2026-09-01
小鹏第二代 VLA 6.3.0 把智驾决策从「眼前这一帧」推到「过去 30 秒 + 未来 6 秒」的时间流,9 月起向 Ultra 车型推送,Lite 版下放至单图灵芯片 G9L Max。
2026 年 8 月 27 日,小鹏开了场「物理 AI 分享会」,把第二代 VLA 模型的 6.3.0 版本端到端放出来。我盯这场发布会很久了,但这次有意思的不是参数又涨了多少,而是小鹏给了一个偏「奇异博士」的说法——这台车现在能往回看 30 秒、往前看 6 秒,「在时间里开车」。
把时间维度塞进智驾决策,这件事比参数扩张 3.5 倍值得说。
过去几年的智驾,本质是「看清楚眼前这一帧」。不管是 BEV、占用网络还是 Transformer,目标都收敛在一件事:把当前传感器输入映射成「此刻的几何+语义」。
但人在开车的时候,从来不只用眼前这一帧。你会凭后视镜里前 5 秒的轨迹判断右后方车会不会挤进来,也会从前方岔路的电动车方向预判几秒后它会不会窜出。驾驶这件事,不只发生在路面上,也发生在时间里。
单帧方案的上限,就是「能识别不能推理」。小鹏这次把"过去—现在—未来"硬塞进同一个模型的输入端,等于把"推理"的物理位置从空间挪到了时间。
新版本里负责"记住过去"的模块叫 Infini-VLA。名字来源于它的底层架构——支持更长的时序上下文,可以把更早的历史状态保留在推理路径上。量产版本把这个窗口定在 30 秒。
30 秒是什么概念?大约是城市道路一个完整信号灯周期的长度,也覆盖了一次并线—前车减速—后车跟车的整段博弈。小鹏在沟通会上放了一段演示:前车在路中掉头,车身刚露出一段空位时,测试车没有立刻加速钻过去,而是等对方完成整个掉头动作再起步。模型理解的是"前车正在掉头"这个持续行为,不是"眼前出现一段空隙"这一帧画面。
这跟人跟别人说话是同一种体验——你不会每听完一句就忘掉上一句。Infini-VLA 给车子装上的,就是这种"短期记忆"。
光有 30 秒记忆还不够。如果模型必须"先看完 30 秒再决策",那这 30 秒就是延迟——一辆以 60km/h 行驶的车,每秒走 16.7 米,等 1 秒可能就错过一次并线窗口。
所以这次另一个关键升级是 Streaming Inference「流式自回归推理」:模型可以边获取输入、边推理、边输出轨迹,不必等完整理解一段历史之后才开始动作。小鹏给出的数据是,决策速度相比上一代提升 300%。
这跟人开车更像了——眼睛看路、大脑判断、手脚操作同时进行。如果某段视野被前车遮挡,目标物从遮挡处窜出来,并行处理能少留一段"等推理完成的空白"。
记得过去、着眼当下,最后还要展望未来。新版本里的 X-Foresight 模块负责推演未来 6 秒。它根据过去 30 秒累积的状态,计算出几种概率更高的后续状态分布,再用 Flow Matching 对这些可能的轨迹做拟合,挑出当下最合适的动作。
小鹏沟通会现场的视频里,一辆对向白车占据了逆向车道。模型要判断的是:对方在等?还是继续往前?还是会让出空间?看清对方在哪只是第一步,理解对方将要做什么,才能决定自己这一步是缓行、绕行还是继续靠近。
这就是防御性驾驶的本质——你不只是在反应,你是在预判。
架构图上的名词很多,回到产品端,VLA 还是要落到真实道路。轮渡码头没有清晰车道线、狭窄山路急弯后挂着悬空树枝、暴雨中电动车突然横穿——这些 corner case 没有标准答案。
小鹏这次把模型参数扩了 3.5 倍。不是为了在某个公开榜单上刷分,而是为了让模型能处理"没见过的问题",而不是为每一种新障碍各写一条规则。
一个依赖固定规则的系统,可以为码头、羊群、暴雨各加一个补丁,但真实道路总会出现你意想不到的情况。更大模型追求的是「处理没见过的」,不是「背下每个场景」。
模型不会凭空获得这种能力。小鹏公布的两个数字值得记一下:
具体做法是:当用户上报或测试中出现一个问题,开发团队用向量检索从数据库里捞出语义相似的更多场景,组成本轮训练的「错题集」。仿真系统再对车型、天气、光照和视角做变化,反复验证同一个模型。真实数据提供题库,仿真负责考试,暴露的问题再回到数据库变成下一轮的错题。
真实 → 仿真 → 错题 → 训练 → 真实,这是一个闭合的飞轮。
参数扩了 3.5 倍,端侧算力没扩那么多,怎么办?小鹏用 Hybrid ViT 重新设计了计算量最高的视觉部分,目标是保留视觉输入+大模型底层能力,让模型能在单颗图灵芯片上跑起来。这就是即将在 9 月推送的第二代 VLA Lite——首发车型包括 G9L Max。
这意味着同一套"在时间里开车"的能力下放到中端车型,而不是只留在旗舰上。
这次还有一个不在主视觉里的升级:Omni 全模态模型 + Master Agent。
过去的座舱助手更像"执行员"——你下一句指令,它接一张工单、做完、了事。Omni 把语言、环境、上下文三种模态统一到同一个模型里,Master Agent 再把一整段对话拆成可执行的任务序列。
当用户说"找个地方靠边停车",系统不能接到语音就在当前车道里刹停——它要先变道至最右侧,观察护栏、公交站和道路环境,排除不合适的区域,找到可以停下的位置。理解语义并从座舱域跨到驾驶域、做连续决策,是这套系统的目标。
VLA 不止用在 L2 辅助驾驶。小鹏在同一场沟通会上透露,搭载第二代 VLA 的 Robotaxi 已经完成超过 2000 单内测,并在广州获得远程测试资质,可主驾无安全员道路测试。
这次还有个更引人注意的彩蛋:视频里左边是车辆,右边是一台机器人在室内完成导航与操作。两种本体共用同一套基座模型。
小鹏通用智能中心负责人刘先明的总结很直白:Car as Robot,汽车即机器人。到了模型这一层,两者本来就没多少分别——感知周围环境、记住之前发生过什么、理解人的意图、把含糊目标变成动作、再到物理世界把它们做完。
把过去 30 秒和未来 6 秒同时放进决策,这件事不只是"参数变大"。它意味着智驾模型的认知单元从「这一帧」挪到了「这段时间」。
这件事的工程难度被低估了——30 秒历史要在端侧被快速访问、未来 6 秒的多种可能性要被并行推演、整个推理还要在毫秒级完成。这背后是流式架构、长上下文检索、轨迹预测三个方向同时推进。
如果 9 月的 OTA 推送节奏和小鹏说的一致——Ultra / Ultra SE 全量铺开、G9L Max 拿到 Lite 版——那"在时间里开车"这件事,会从发布会 demo 变成大多数小鹏车主每天都能用到的能力。
到那时候,「驾驶这件事到底发生在哪」的答案就很清楚了:不在眼前这一帧,在时间里。
参考资料