WAIC 2026 现场真相:具身智能的胜负手不是模型,是「经验密度」
Site Owner
发布于 2026-07-19
WAIC 2026 智启具身论坛罕见共识:具身智能从「拼 Demo」走向「拼经验密度」。面壁 MiniCPM-RobotManip 在 RMBench 拿到 53 分(π0.5 仅 10 分),京东三年要攒 1000 万小时高质量数据。
WAIC 2026 现场真相:具身智能的胜负手不是模型,是「经验密度」
让机器人「按一下按钮,按五下」,是件挺费劲的事。
不少 VLA 模型要么按一下就停,要么按起来根本停不下来。它们不记得自己已经按过几次。这个小毛病背后,是具身智能领域一直没解决好的一个问题:记忆。
2026 年 7 月 WAIC(世界人工智能大会)开幕的第二天,智元、清华大学、Physical Intelligence、Genesis、Dyna Robotics、Sunday Robotics——五家全球最具代表性的具身智能团队,被「请」上了同一个圆桌。它们各自手里都有 SOTA(当前最优)成绩,立场却南辕北辙。一件罕见的事发生了:吵完之后,它们竟然收敛出一个共同判断。
下一阶段不再拼 Demo 花哨,而是拼谁能先把「经验」规模化。

这件事如果被翻译成「场面话」,就是大模型公司讲了无数遍的故事。但如果被翻译成「跑分」,就是 53 分对 10 分的悬崖式差距。
面壁智能同日在 WAIC 开源的 MiniCPM-RobotManip,在考验上下文记忆的 RMBench 榜单上拿到了 53 分;主流 π0.5 在同一个榜单上,是 10 分,接近随机水平(来源:面壁智能 WAIC 发布会)。一年前,这件事大家只当作 VLA(视觉-语言-动作)模型的小缺陷。WAIC 2026 把它摆到了舞台中央。
为什么?
因为「记不住」这个能力缺陷,一旦放到工厂、产线、家政场景里,就是机器人反复出错、反复重新开始的根因。也是为什么过去一年,所有做具身智能的团队都在闷头死磕同一个问题——经验从哪来、怎么算好、能不能省钱。
一、物理 AI 三道墙,把大模型的胜利公式挡住了
先亮战报。
智元机器人手里握着 GO-2——它在 LIBERO 基准上以 98.7% 刷新了 SOTA;世界模型 GE-Sim 2.0 在 WorldArena 全球第一;龙旗南昌产线已稳定运行 3 个月,成功率 99.99%(来源:WAIC 智启具身论坛,智元机器人姚卯青)。
Dyna Robotics 的 DYNA-1 把折餐巾做到 99.4%、24 小时折 85 张以上,已经开进真餐厅试运营(来源:WAIC,Dyna 创始人马也骋)。
清华计算机副研究员苏航,用 TUTOR 方法把长程任务的自主成功率从 8.3% 拉到 35%(来源:WAIC 智启具身论坛)。
Physical Intelligence 的 π0.7 更极端:单一模型开箱即通吃多任务,连没训练过的机械臂都能零样本迁移(来源:WAIC,PI 研究科学家任至意)。
表面看,这一串数字都在宣告「通用机器人要来了」。把几份技术路线叠在一起看,刀光剑影:
- 智元盯着数据、表征、闭环「三道墙」,靠全栈飞轮硬冲;
- PI 说墙是上下文,泛化会自己涌现;
- Dyna 说通用模型不够可靠,专用模型不够可扩展,先把可靠性做到极致;
- 清华说是机器人自救能力——真智能不是不犯错,是知道怎么改回来;
- Genesis 押注人手数据手套,从全世界的日常家务里抠经验。
华山论剑第一招,是先否掉对方对战场的判断。但吵到一半,它们发现了一件共同的事——物理 AI 的 Scaling 之路,被三道墙堵住了。
第一道是数据墙。物理 AI 的数据量只有大模型的两万分之一。互联网规模的语料可以轻松堆出,但想让一个机器人见过一万种拧瓶盖的场景,账单比机器人先觉醒。
第二道是表征墙。数字智能是「知识系统」,物理智能是「经验系统」(来源:智元姚卯青)。前者靠语言表征就能大规模积累,后者还在满世界找「经验的通用表征」。
第三道是闭环墙。模型可以在屏幕里把一只杯子旋转 90 度,机器人却必须知道从哪里抓、用多大力、抓空以后怎么调整。像素里的合理,不等于物理上的可执行。
二、经验密度:录画面是「一小时录像」,含目标/状态/动作/失败/结果才是「一小时经验」
要把「经验」规模化,先得定义什么叫「一小时经验」。
WAIC 给出的判据很硬核:
只录画面和关节角度,那是「一小时录像」;同时记下任务目标、物体状态、动作质量、错在哪、结果如何,才叫「一小时经验」。
数据规模回答「见过多少」,经验密度回答「学到多少」。两者差着一整条产业鸿沟(来源:智元姚卯青)。
这件事为什么难?因为机器人要在「经验系统」里管五件事:空间感知、物理交互、精细操作、失败恢复、工具使用。每一件都需要数据,但数据的「干净程度」天差地别。
WAIC 圆桌上,五家团队在「经验从哪来」上分成了三个阵营:
智元:全都要。 智元和觅蜂科技打造具身数据「平台型供给」基础设施,开源了行业首个百万真机数据集 AGIBOT WORLD,目前累计下载 120 万余次(来源:WAIC,智元机器人姚卯青)。这是「数据多就赢」的路子——但代价是真机遥操作太贵,一个人盯一台机器,采集还不如自己上手。
Dyna:不比数据多,比用得省。 Dyna 把 200k+ 小时数据摞成金字塔,主打「1 小时以内的后训练就能迁到全新任务」。它的创始人马也骋在圆桌上分享了一个反向逻辑:「部署数据放到下一次预训练中,接下来的部署时间就会越来越短,最终达成零成本在新环境完成同样任务。」(来源:WAIC 圆桌)
Genesis:仿真快 1000 倍 + 人手手套抠经验。 Genesis 的路线是把人手机器手装上数据手套,让人正常洗碗拧瓶盖,顺手留下动作——全世界每天都在干家务,抠出一小块,机器人就有了接近人类活动规模的数据入口(来源:Genesis 联合创始人王尊玄)。
清华苏航则泼了一盆冷水:人手不是夹爪。人有全局视野、触觉、常识,机器人常常只能从腕部相机看到巴掌大一块。多塞人类动作,不等于机器人学会人类技能。数据多,不等于数据能用(来源:WAIC 智启具身论坛)。
Sunday Robotics CEO 赵子豪从另一个维度补刀:「短期内,无本体数据是最高杠杆的选择,因为成本极低、没有环境差距。但长期来看,当机器人真正部署到多样化环境中,部署数据将成为终极数据源。」(来源:WAIC 圆桌)
吵到这里,所有人才看清一件事:Demo 时代已经过去。 谁再喊一句「我的机器人叠衣服叠得最溜」,大家就当看戏。下一阶段要回答的问题只有一个——经验能不能被规模化。

三、面壁给出了一个被忽视的答案:让带记忆的推理成本追平单帧模型
在「经验从哪来」的阵营战打得不可开交时,面壁智能悄悄换了一个战场——它不打数据规模战,打的是「让模型能记住」。
面壁选择的技术路线和大多数团队不一样。多数具身智能团队的思路是先扎进一个具体场景(叠衣服、分拣),把这件事做到极致,再往外延伸——「从点到面」。MiniCPM-RobotManip 反过来,从一开始就想做一个通用具身模型,能完成叠衣服、做三明治这种长流程任务,再落到具体场景里——「从面到点」(来源:面壁智能 WAIC 发布会)。
这条路要解决的最大技术难题是:计算量。
VLA 模型每次推理,通常要同时处理三张图片(两个手腕摄像头 + 一个主视角)+ 一段文本指令,然后输出一个动作。每秒要重复好几次。如果再把过去几秒甚至几十秒的画面都放进来一起算,处理信息量会成倍增长——很多团队的算力和推理速度扛不住,只能选择「看一帧、算一步」。
面壁切入这个赛道,靠的是过去两年半在多模态大模型上的积累。它们的 MiniCPM-V/O 系列有一个很突出的技术特点,叫视觉 Token 极致压缩——图片信息量越大,需要的 Token 就越多;压缩得越狠,计算量越少,推理速度越快。
正是这个能力打底,MiniCPM-RobotManip 才能在「要不要保留历史记忆」这件事上,给出一个不一样的答案:流式计算的方法让带记忆的推理成本,追平了传统单帧反应式模型的成本。当然 MiniCPM-RobotManip 参数也比 π0.5 要小(来源:面壁智能 WAIC 发布会)。
跑分说话:保持多模态大模型通用能力,并在仿真评测场景上采用通用多任务统一训练,在指标上达到专家模型水平;更重要的是在 RMBench(考验上下文记忆的榜单)上,主流 π0.5 是 10 分(接近随机),MiniCPM-RobotManip 能达到 53 分(来源:面壁智能 WAIC 发布会)。
53 分对 10 分。 这就是 WAIC 2026 给出的最具象的答案:上下文记忆不是「锦上添花」的能力,是「能不能用」的入场券。
同期面壁发布的 MiniCPM-RobotTrack 解决了另一类问题——断网也能跟人走。这个模型基于 MiniCPM4-0.5B + MLP 结构训练,参数规模只有 0.9B。官方公布的评测结果显示,单目标跟踪成功率 89.8%、动态多目标 73.4%、指令模糊情况 80.4%——三项都是目前开源方案里的最优结果(来源:面壁智能 WAIC 发布会)。
工程优化同样关键。围绕宇树 Go2 机器狗的完整链路做系统级优化,最终在机器狗自带的本地算力上,稳定跑到每秒 5 帧以上,端到端响应延迟大约 180 毫秒。拿到一台机器狗跑一个一键部署脚本,就能让它具备纯本地的自然语言指令跟踪能力(来源:面壁智能 WAIC 发布会)。
模型发布得快,能不能被高效地跑起来,还要看背后的推理框架跟不跟得上。这次面壁和明体科技(MemBodied)+ 北邮 + 北大联合推出具身推理框架 PhyAI,专门做具身智能模型的端侧极速推理和云端大规模强化学习训练。按官方公布的数据,PhyAI 在 NVIDIA RTX 5090 上运行 π0、π0.5、GR00T 时,分别带来 2.9 倍、1.8 倍、2.3 倍 的推理加速。面壁这次发布的机器人模型在当天就完成了适配,通过 CUDA Graph 和团队专门为其编写的融合算子,推理帧率从 10Hz 提到了 33Hz,进一步优化后在 NVIDIA H20 上能跑到 37Hz(来源:面壁智能 WAIC 发布会)。

四、竞争单位,正在从「模型」变成「系统」
WAIC 2026 给出的另一个隐藏信号,是京东集团副总裁段楠在演讲里点破的一句话:
当 AI 走出聊天框、进入物理世界,竞争单位不再是单个模型,而是数据、模型、算力、硬件和场景能不能组成一套真正跑起来的系统。
京东这次把 JoyAI 大模型矩阵、具身数据体系、云基础设施和 JoyInside 硬件入口集中摆在了一起。从 JoyAI-Image-Edit(空间图像编辑)、JoyAI-VL-Interaction(持续观察和实时回应)、JoyAI-RA(机器人动作学习),一直到 JoyEgoCam / EgoLive / JoyAI-Sim / JoyInside——覆盖了 AI 进入物理世界的完整链路:看见、理解、交流、行动、学习,直至落地(来源:WAIC,京东段楠演讲)。
其中最值得拆解的是三层数据流水线:
第一层——把真实经验采下来。 京东开源的 EgoLive 首批包含约 2000 小时视频、65,866 段数据和 346 种真实任务,覆盖家庭、仓储、药房等场景。第一视角数据记录的不只是「人在做什么」,还有人看见了什么、手怎样运动、动作按照什么顺序发生(来源:WAIC,京东段楠演讲)。
第二层——把人的经验翻译成机器人能用的数据。 人的手与机器人关节结构完全不同,人类演示不能直接训练机器人。JoyAI-Sim 把真人动作放进仿真环境,检查它是否满足机器人的关节、碰撞和物理约束,再转换成机器人可以学习的轨迹。
第三层——验证经验到底有没有用。 JoyAI-RA 把第一视角视频、仿真轨迹、真实机器人数据和网络数据放进统一训练框架,再通过仿真和真机任务检验效果。如果一批数据加入以后机器人任务成功率没有提高甚至下降,那无论它多清晰、标注多完整,都不能算好数据(来源:WAIC,京东段楠演讲)。
到这里,模型同时成为数据的消费者和质检工具。段楠给了一个数字:京东计划两年累计 1000 万小时高质量数据,把具身训练扩展到千卡规模集群,并把数据处理成本降低 10 倍以上(来源:WAIC,京东段楠演讲)。
五家公司,五种路线,但都指向同一个结论——单一模型的跑分已经不够看了,系统能不能跑通才是新标尺。

五、Demo 时代过去了,但 ChatGPT 时刻还要等
WAIC 2026 把过去两年里大家在私下嘀咕、不愿摆上台面的话,第一次公开讲清楚了:
Demo 时代已经过去,「经验时代」才刚开始。
谁能解决上下文记忆,谁就能拿走下一个 ChatGPT 时刻。
53 分跑到 90 分还要多久?面壁没给答案,智元没给答案,Dyna 没给答案,PI 也没给答案。它们只达成一个判断——
两年之内,可能有戏。
这个时间表,赌的是「经验系统」的范式能不能跑通:数据从哪来、怎么标、怎么验证、怎么喂给模型、模型怎么消化、怎么装进硬件、怎么在真实环境里出活——每一个环节都需要不止一家公司拿出真东西。
WAIC 2026 把这件事从「Demo 拼花哨」推到了「闭环拼耐力」的拐点。下一个分水岭,可能就是 RMBench 从 53 分跑到 90 分的那一天。