小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」
Published on 2026-08-28
小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」 8 月 27 日,小鹏开了一场「物理 AI 分享会」。会上公布的东西不少,但所有人都听出了那个关键词——时间。 小鹏给第二代 VLA 加了一个「阿戈摩托之眼」:往回转,可以回溯过去 30 秒的世界;向前转,可以预判未来 6 秒会发生什么。9 月开始向 Ultra / Ultra SE 推送,单图灵芯片的 Max 车型会拿到蒸馏版。 <...
小鹏 VLA 2.0 上车:当车企开始比 LLM 更懂「时间」
8 月 27 日,小鹏开了一场「物理 AI 分享会」。会上公布的东西不少,但所有人都听出了那个关键词——时间。
小鹏给第二代 VLA 加了一个「阿戈摩托之眼」:往回转,可以回溯过去 30 秒的世界;向前转,可以预判未来 6 秒会发生什么。9 月开始向 Ultra / Ultra SE 推送,单图灵芯片的 Max 车型会拿到蒸馏版。
<!-- 配图:fig1 — VLA 2.0 时间维度架构图(记忆窗口 / 推理 / 预判三大模块)-->30 秒记忆 + 6 秒预判,听上去像是产品参数发布会上的常规数字。但如果你拆开它,会发现这两个数字背后藏着 2026 年汽车行业最反常识的一件事——车企正在用大模型的能力边界,重新定义自己是谁。
一、为什么车企要在 2026 年集体改名叫「物理 AI 公司」
发布会现场,小鹏通用智能中心负责人刘先明抛出一句定性:「Car as Robot,汽车即机器人」。
这听起来像营销话术,但你往后看一眼行业就会发现,这不是小鹏一个人的判断:
- 特斯拉:汽车、Robotaxi、Optimus 机器人、AI 训练早就进了同一张组织蓝图
- 理想:把公司定位从「智能汽车」改成「具身智能企业」
- 国内多家造车新势力:把 L2 智驾、L4 Robotaxi、人形机器人放在同一支团队研发
为什么是这个时间点?
因为 VLA 模型(Vision-Language-Action,让模型同时看、说、做)第一次让**「物理 AI」成了一个有产品边界的产品类目**。
过去车企卖的是「带 ADAS 的车」——卖点是激光雷达数量、算力 TOPS、接管里程数。这套打法仍然属于功能车逻辑:把一堆硬件 + 一堆规则堆起来,比谁堆得更多。
现在小鹏的演示里出现了一个反例:测试车遇到一辆对向白车占据逆向车道。模型不是按"遇到障碍→刹车"这种规则工作,而是先判断对方要"等待 / 继续向前 / 让出空间"哪一种,下一步才决定自己怎么开。看清对方在哪里只是第一步,理解对方将要做什么才能决定自己下一步的操作。
这就是 VLA 2.0 跟过去 ADAS 的根本差别:驾驶不再发生在路面上,而是发生在时间里。人在开车时从来不只看眼前这一帧,会根据前几秒的记忆判断后方,也会根据前车的减速预判几秒后可能出现的小电驴。VLA 第一次让车有了这种"短期记忆 + 预判"的能力。
而一旦"记忆 + 预判"成为驾驶的核心能力,卖点就不再是硬件堆料,而是算法能力。车企第一次在产品定义权上输给了一群做模型的人。这就是 2026 年车企集体改名"物理 AI 公司"的真正原因。
<!-- 配图:fig2 — Infini-VLA 时序记忆与 30 秒窗口示意 -->二、30 秒记忆是怎么做出来的
小鹏把"过去 30 秒"这一段时序记忆命名为 Infini-VLA。几个关键工程决策:
参数量扩 3.5 倍。这不是为了"显得更强",而是因为短期记忆需要模型在每一帧都把"前面发生了什么"作为上下文。上下文越长,对模型参数量的需求是非线性增长——你不能让 7B 模型背 30 秒的高维路况。
历史记忆设为 30 秒,不是 60 秒、不是 120 秒。小鹏的判断是:驾驶任务有实时性约束,30 秒足够覆盖"前车掉头""对向借道""前车减速"这一类典型预判场景,再长就会吃掉端侧算力、挤压当下决策。这是有意识的取舍。
流式自回归推理(Streaming Inference),决策速度提升 300%。模型边获取输入、边推理、边输出轨迹,不必等完整理解一段历史之后才开始动作。这对应人开车时眼睛看路、大脑判断、手脚操作同时进行。
举个具体的例子:前车在路中掉头,车身后方一度露出可以穿过的空位。过去的 ADAS 会怎么反应? 检测到前方空位,加速。VLA 2.0 怎么反应? 调出 30 秒记忆,识别"前车正在掉头",等待对方完成掉头后再向前。
这段判断不是"看到什么做什么",而是"理解对方持续发生什么之后再做什么"。VLA 第一次让车具备了这种"对话级的上下文理解"。
<!-- 配图:fig3 — X-Foresight 多轨迹预判示意 -->三、6 秒预判靠的是拟合多种未来
预判部分小鹏拆成了两个模块:
- X-Foresight:根据历史状态对未来 6 秒进行推演
- Flow Matching:对多种可能的轨迹分布进行拟合
注意这两者不是一回事。X-Foresight 解决"下一步可能是哪几种",Flow Matching 解决"我应该选哪一种"。
老司机们常说的"防御性驾驶",本质就是一种预判——你提前 2-3 秒判断对方可能要变道,提前松开油门。小鹏的预判窗口是 6 秒,比人类司机的"几秒判断"长了 1 倍多。
但有意思的不是"6 秒"这个数字,而是 VLA 把预判从司机的本能变成了模型可计算、可验证的工程指标。发布会上小鹏公布了仿真验证的口径:今年 6 月至今,每日仿真验证的新模型数量提升 290%,综合安全能力提升 20 倍。
真实数据提供题库,仿真负责考试,暴露的问题再回到数据库变成新的错题——这是小鹏把 VLA 量产化背后的工程底座。模型单次训练的数据吞吐量已达 1 亿个视频片段,背后是一套向量化的检索系统:用户上报或测试中出现一个问题后,开发团队可以从数据库中找出更多语义相似的场景,组成更有针对性的"错题集"。
四、车端大脑的重构:Omni 全模态 + Master Agent
VLA 2.0 不只是把驾驶模型升级了,它把车上的"大脑"也一起重构了。
- Omni 全模态模型:结合语言、环境和上下文理解用户
- Master Agent:把意图分成车辆可以执行的任务
这套架构解决的是一个非常具体的痛点:当用户说"找个地方靠边停车",系统不能在接到语音后就在当前车道里刹停。它要先变道至最右侧、观察护栏、公交站和道路环境、排除不合适的区域、找到可以停下的位置。
过去的车机系统是「单工单执行员」——每条语音指令都是一次独立任务。现在的 Master Agent 是「工单总管」——它理解这些工单共同指向哪个目标。
这就是 VLA 从"驾驶辅助"跨向"具身智能"的关键一步:模型从接一条指令完成一个动作,进化到接一段对话完成一系列动作。
五、9 月是验证场,也是分水岭
发布会上小鹏还留了一个机器人彩蛋:视频一边是车辆,另一边是机器人在室内完成导航与操作。两种本体用了同一套基座模型。这呼应了开头那句「汽车即机器人」——汽车之外,他们还会做人形机器人。
按小鹏公布的最新口径,搭载 VLA 2.0 的 Robotaxi 已获得广州市智能网联汽车远程测试资质,主驾无安全员;Robotaxi 内测已完成 2000+ 单。
9 月开始上车的 VLA 2.0,是「物理 AI 公司」这个新身份的真实验证场。
为什么这么说?
- 如果车主真的感觉到"它记得更多、判断更早、反应更快",那车企改名就不是营销,是产品力升级
- 如果车主感觉不出来,或者频频出现「特斯拉撞铁丝网」这种 corner case——那「物理 AI」就只是一个新故事,没有新能力
具身智能行业今年有个共识变化:从「骂 VLA、吵世界模型」转向「我现在只要数据」。小鹏把模型扩 3.5 倍、把仿真验证扩 290%,背后的逻辑也是这个——别再争论 VLA 路线对不对了,数据飞轮 + 仿真测试才是 2026 年具身智能的真正分水岭。
奇异博士可以在一瞬间看尽多种未来,一家现实世界里的公司却只能一个版本、一辆车地向前。
30 秒记忆 + 6 秒预判只是开始。车企会不会在 2027 年变成"机器人公司",取决于 9 月上车的车主愿不愿意为一个"在时间里开车"的版本多付一万块。
本文数据来源:爱范儿 8 月 27 日《小鹏新版 VLA 9 月实装:记住过去 30 秒,预判未来 6 秒》(陈世琛),https://www.ifanr.com/1677118。所有数字(30 秒 / 6 秒 / 3.5 倍 / 300% / 290% / 20 倍 / 2000 单 / 1 亿视频片段)均为该文一手报道,未经独立验证。