小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」
发布于 2026-08-28
小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」 8 月 27 日,小鹏开了一场「物理 AI 分享会」。会上公布的东西不少,但所有人都听出了那个关键词——时间。 小鹏给第二代 VLA 加了一个「阿戈摩托之眼」:往回转,可以回溯过去 30 秒的世界;向前转,可以预判未来 6 秒会发生什么。9 月开始向 Ultra / Ultra SE 推送,单图灵芯片的 Max 车型会拿到蒸馏版。 <...
小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」
8 月 27 日,小鹏开了一场「物理 AI 分享会」。会上公布的东西不少,但所有人都听出了那个关键词——时间。
小鹏给第二代 VLA 加了一个「阿戈摩托之眼」:往回转,可以回溯过去 30 秒的世界;向前转,可以预判未来 6 秒会发生什么。9 月开始向 Ultra / Ultra SE 推送,单图灵芯片的 Max 车型会拿到蒸馏版。
<!-- 配图:fig1 — VLA 2.0 时间维度架构图(记忆窗口 / 推理 / 预判三大模块)-->30 秒记忆 + 6 秒预判,听上去像是产品参数发布会上的常规数字。但如果你拆开它,会发现这两个数字背后藏着 2026 年汽车行业最反常识的一件事——车企正在用大模型的能力边界,重新定义自己是谁。
一、为什么车企要在 2026 年集体改名叫「物理 AI 公司」
发布会现场,小鹏通用智能中心负责人刘先明抛出一句定性:「Car as Robot,汽车即机器人」。
这听起来像营销话术,但你往后看一眼行业就会发现,这不是小鹏一个人的判断:
- 特斯拉:汽车、Robotaxi、Optimus 机器人、AI 训练早就进了同一张组织蓝图
- 理想:把公司定位从「智能汽车」改成「具身智能企业」
- 国内多家造车新势力:把 L2 智驾、L4 Robotaxi、人形机器人放在同一支团队研发
为什么是这个时间点?
因为 VLA 模型(Vision-Language-Action,让模型同时看、说、做)第一次让**「物理 AI」成了一个有产品边界的产品类目**。
过去车企卖的是「带 ADAS 的车」——卖点是激光雷达数量、算力 TOPS、接管里程数。这套打法仍然属于功能车逻辑:把一堆硬件 + 一堆规则堆起来,比谁堆得更多。
现在小鹏的演示里出现了一个反例:测试车遇到一辆对向白车占据逆向车道。模型不是按"遇到障碍→刹车"这种规则工作,而是先判断对方要"等待 / 继续向前 / 让出空间"哪一种,下一步才决定自己怎么开。看清对方在哪里只是第一步,理解对方将要做什么才能决定自己下一步的操作。
这就是 VLA 2.0 跟过去 ADAS 的根本差别:驾驶不再发生在路面上,而是发生在时间里。人在开车时从来不只看眼前这一帧,会根据前几秒的记忆判断后方,也会根据前车的减速预判几秒后可能出现的小电驴。VLA 第一次让车有了这种"短期记忆 + 预判"的能力。
而一旦"记忆 + 预判"成为驾驶的核心能力,卖点就不再是硬件堆料,而是算法能力。车企第一次在产品定义权上输给了一群做模型的人。这就是 2026 年车企集体改名"物理 AI 公司"的真正原因。
<!-- 配图:fig2 — Infini-VLA 时序记忆与 30 秒窗口示意 -->二、30 秒记忆是怎么做出来的
小鹏把"过去 30 秒"这一段时序记忆命名为 Infini-VLA。几个关键工程决策:
参数量扩 3.5 倍。这不是为了"显得更强",而是因为短期记忆需要模型在每一帧都把"前面发生了什么"作为上下文。上下文越长,对模型参数量的需求是非线性增长——你不能让 7B 模型背 30 秒的高维路况。
历史记忆设为 30 秒,不是 60 秒、不是 120 秒。小鹏的判断是:驾驶任务有实时性约束,30 秒足够覆盖"前车掉头""对向借道""前车减速"这一类典型预判场景,再长就会吃掉端侧算力、挤压当下决策。这是有意识的取舍。
流式自回归推理(Streaming Inference),决策速度提升 300%。模型边获取输入、边推理、边输出轨迹,不必等完整理解一段历史之后才开始动作。这对应人开车时眼睛看路、大脑判断、手脚操作同时进行。
举个具体的例子:前车在路中掉头,车身后方一度露出可以穿过的空位。过去的 ADAS 会怎么反应? 检测到前方空位,加速。VLA 2.0 怎么反应? 调出 30 秒记忆,识别"前车正在掉头",等待对方完成掉头后再向前。
<!-- 配图:fig3 — X-Foresight 多轨迹预判示意 -->