WAIC 2026「华山论剑」:具身智能押出 GPT-3 时刻,最快的玩家带着 1.5B 模型进场
Site Owner
发布于 2026-07-20
WAIC 2026 智启具身论坛首次跑出「3-4 年」共识;面壁智能发布 1.5B 端侧 VLA 模型开源进场,参数腰斩、本地能跑、推理 33Hz。三大路线之争比 LLM 当年残酷。

WAIC 2026「华山论剑」:具身智能押出 GPT-3 时刻,最快的玩家带着 1.5B 模型进场
7 月 19 日这一天,上海 WAIC 智启具身论坛挤进了一件反常识的事。
Physical Intelligence(π0.7 的背后)、Genesis AI、Dyna Robotics、Sunday Robotics,海外四家头部带队;智元、清华大学、腾讯 Robotics X,国内三股力量同台。这些公司平时谁也不服谁,但圆桌环节被主持人问到「机器人 ChatGPT 时刻还有多远」时,六个答案挤进了 2 到 5 年,算术平均 3.4 年。
圆桌没人敢拍胸脯说 1 年,但也没人敢拖到 10 年。
这是具身赛道头一次跑出明确共识。要理解它的重量,得先看清共识背后的硬数字:物理 AI 当前的数据量只有大模型的「两万分之一」(智元合伙人姚卯青原话)。语言模型头部已经吃下 100 万亿 token——对应约 100 亿小时语料;物理交互还在为「1 亿小时门槛」挣扎。这是 10000 倍的差距。
各位顶尖玩家押的不是这个差距多久抹平,而是谁先把抹平的成本压到桌面以下。
<!-- 配图:物理AI数据规模对比图 / Mermaid -->
数字智能和物理智能,差着一整套经验系统
「数字智能是知识系统,物理智能是经验系统。」姚卯青在 WAIC 圆桌上把两件事拆得直白。
语言智能的原始材料是文字——符号密度高、噪声低、冗余规则化。一句话能塞进几十个 token,一个 token 训练三遍就能形成表征,飞轮转得起来。物理智能的原始材料是连续视频、关节角度、力反馈。这些东西里 90% 是「机器人在这 0.3 秒里左手腕关节微调了 0.7 度」——信息密度低,物理噪声高。
更要命的是「经验」和「经验密度」的鸿沟。
录画面加关节角度,那是「一小时录像」。同时记下任务目标、物体状态、动作质量、错在哪、结果如何,才叫「一小时经验」。 数据规模回答「见过多少」,经验密度回答「学到多少」。两者差着一整条产业鸿沟(WAIC 报道,2026-07-19,新智元)。
经验系统至少管五件事:空间感知、物理交互、精细操作、失败恢复、工具使用。每一项都要求模型把历史观测纳入判断,而不是只看「这一帧」。
「这一帧」恰好是当下绝大多数 VLA 模型的默认姿态——视觉-语言-动作三件套看着当下的画面、听着当下的指令、吐出当下的动作。每一秒推理好几次,连续流畅没问题,但只要碰上「按按钮 5 下」这种长程任务,模型要么按 1 下就停,要么按起来不停(金色传说大聪明报道,2026-07-19)。
问题不在机器人笨,是模型架构里没给记忆留位置。
<!-- 配图:经验系统五要素图 / Mermaid -->
三大路线之争,比 LLM 当年更残酷
路线一,数据从哪来。
智元全都要,押全栈飞轮;和觅蜂科技打造的开源数据集 AGIBOT WORLD 累计下载已超 120 万次;姚卯青站在「物理 AI 三道墙」(数据墙、表征墙、闭环墙)前从头数。
Genesis 反着走,押人手数据手套,让人正常洗碗拧瓶盖,顺手留下动作。全世界每天都在干家务,抠出一小块就够了;代价是手套不能取代机器人本体的全部感知,全球视野、触觉、常识一个不能少。
Sunday Robotics 更极端,主张三指夹爪,先敲门再说。CEO 赵子豪的原话是:短期内「无本体数据」是最高杠杆的选择,因为成本极低;长期看,部署数据是终极数据源。
清华苏航把三种路线都泼了一盆冷水:人手不是夹爪。多塞人类动作,不等于机器人学会人类技能。 数据多,不等于数据能用(WAIC 报道,2026-07-19)。
路线二,模型架构:VLA 派 vs 世界模型派。
「VLA 已死」的说法在网上流传甚广。Physical Intelligence 的任至意回了一刀:「目前为止,我还没有看到有哪一家做出了比 π0.7 更令人印象深刻的 demo。所以,VLA 可能还没死。」
<!-- 配图:三大路线分歧矩阵 / Mermaid -->