具身公司变"老实"了:WRC 2026 把"卷大脑"换成"卷数据"
胡新宇
Published on 2026-08-21
Loading...
胡新宇
Published on 2026-08-21
WRC 2026 后,具身智能行业最大的新闻不是哪家算法赢,而是整个行业集体「老实」了——从卷 VLA / 世界模型转向卷物理数据。王兴兴「最后几毫米」金句、4 家厂商访谈、5100 元数据底座,共同指向一个判断:具身智能的 GPT-3 时刻不会来自模型突破,而会来自数据管道的成熟。


王兴兴在科创板上市次日站上世界机器人大会的讲台,第一句话承认的是「偏差」。
2026 年 8 月 19 日,「人形机器人第一股」宇树科技登陆科创板,发行价 150.80 元,开盘报 1100 元,暴涨 629.44%,收盘 845 元,总市值 3400 亿元。创始人王兴兴持股约 30%,首日持股市值超千亿,直接坐上科创板 90 后首富的位子(来源:创业邦 2026-08-20)。
上市次日,他站在 2026 世界机器人大会的主论坛上,发表了题为《从展品到产品:人形机器人产业的下一个十年》的演讲。台下 300 多家机器人公司刚刚结束布展。这一年最大的新闻是——整个行业悄悄换了剧本。
去年还在被反复挂上展台、演讲和采访的 VLA(Vision-Language-Action),今年很少再被当作完整答案来讲。「端到端」也退到更靠后的位置。接棒的新词「世界模型」还在争论自己到底要不要生成视频、要不要预测动作后果、要不要在潜空间预演。像去年那种围绕技术路线产生的激辩场面,今年几乎消失了。
取而代之的是一个最朴素的共识——所有没有数据支撑的算法路线之争,最后都是梦幻泡影(来源:WRC 观察 2026-08-21)。
这句话是今年 WRC 给整个具身智能行业的「判决书」。
<!-- 配图:WRC 2026 路线收敛示意 -->
王兴兴在演讲里给出一句难得的坦诚:
「目前全球具身智能最大的瓶颈,就是 AI 模型的输入和输出,与真实世界之间仍然存在偏差。从大的趋势来看,现在的模型其实没有太大问题,大差不差能够执行你的任务。问题往往发生在最后几个厘米,甚至最后几个毫米。」(来源:创业邦 2026-08-20)
这句话翻译成大白话就是:大模型在仿真里看着都对,但真到机器人身上,最后几厘米的精度就是过不去。
宇树在 2020 年初就做过基于视频生成的世界模型,年底发现效果不理想,搁置了一段时间。去年又重新大力发展。这条路线上,宇树起步很早,但今年承认问题最坦率。
王兴兴还透露了一个反常识的事实:宇树目前绝大部分 AI 团队的工作,是推动机器人真正进入家庭和工厂里干活。这部分事情没大规模推广,最主要的原因是「目前的效率和泛用性能力还不够高」。机器人能做简单装配,但效率比人工更低;每次有新任务都要重新调整。
这是宇树作为「人形机器人第一股」上市当天讲的实话。资本市场给的是 3400 亿的市值,但公司自己承认:产品还没 ready。
WRC 现场观察组和行业内 6 家公司聊下来,发现一件反常的事——今年没人愿意再说自己的算法路线最厉害。
王兴兴把偏差归因到「AI 模型的输入和输出与真实世界之间仍然存在偏差」,不是模型本身不行,是模型和物理世界没对齐。这句话和他在演讲里反复强调的「今年 4 月我们刷新了人形机器人最快奔跑纪录」形成微妙对比——表演级的运动能力可以靠模型堆出来,但干活级的精度不行。
自变量创始人王潜的总结更直接:VLA 主要回答「下一步做什么」,世界模型则帮助机器人理解「这样做以后会发生什么」。两者不是替代关系,而是会逐渐在统一模型中融合。
这家公司去年押注 VLA,今年的观察重点变成 WALL-WM——一个「以完整事件对齐视觉、语言和动作」的统一模型。但统一模型的训练数据,从哪儿来?
擎朗智能把这件事说得最直接:现在采集数据本身不难,让采集到的数据真正提升模型能力才难。戴个头环拍几小时视频,数据远远不能直接用。
从原始视频到可训练的结构化数据,中间要经过去畸变、姿态估计、深度重建、手物分割、自动标注等一系列处理环节。如果这套「数据炼油」能力跟不上,采集再多原始数据也只是「原油」,没法变成驱动模型的「燃料」。
星海图更激进:VLA 和世界模型本质相通,都是把输入转化为 Token,通过 Transformer 多层神经网络完成编码,再通过自监督方式开展预训练。二者区别仅在于自监督训练的方式不一样。
四家公司的共识落在同一句话上:算法路线不重要,数据才重要。
<!-- 配图:三类数据采集方案对比 -->
WRC 上另一个明显变化——展馆里最热闹的地方不是讲模型的发布会,而是头环、腕部相机、触觉手套、灵巧手、遥操作台和数据工厂。
具身智能的数据采集主要走三条路:
第一条:无本体数采(真人穿戴)
不依赖机器人本体,通过头环、手套等穿戴设备采集人的动作。自变量推出的 QUANXTA Zero 方案,具备全身移动数采和移动采集数据本体回放能力,数据入库有效率超过 85%(来源:WRC 观察 2026-08-21)。
但这种数据有个死结——人的身体结构和动作方式与机器人不同,触觉、关节误差这些信号在穿戴数据里基本丢失。
第二条:真机遥操
让真人远程操控机器人执行任务,记录完整的状态、动作、环境反馈。这是目前成本最高但数据质量最好的一类。智身科技的判断很直接:「它的世界 ≠ 我的世界」,数据规模再大,没办法替代我们自己机器人在真实目标场景下产生的交互数据。
第三条:仿真合成
量大、能扩场景多样性,但 sim-to-real 的鸿沟让这些数据没办法直接用。物理引擎再逼真,也模拟不出真实咖啡机出水口的微妙差异、不同材质杯子表面的摩擦力变化、顾客临时伸手干扰操作轨迹这些真实世界的「意外」(来源:擎朗智能访谈)。
还有一个正在冒头的方向是触觉数据。一目科技的 TouchNet 想把真实接触中的压力、纹理、滑动、材质、力反馈变成可复用的数据基础设施。帕西尼同时在做机器人端的触觉传感器和灵巧手,以及真人穿戴的触觉采集手套。
WRC 不只是「产品发布会」,它还透露了三个产业信号。
「从展品到产品」——这六个字是宇树给自己,也是给整个行业提的命题。展品级的机器人已经有了(翻跟头、跳舞、打拳),产品级的机器人还没有(能在家庭和工厂稳定干活的机器人)。
墨奇智能(MORPHI)的轮式机器人 MORPHI KINO 在 WRC 上完成了一场 15 分钟连续家务演示:收拾茶几、发现冰箱缺货自动补货、开关洗烘设备、叠衣服。单动作早就不是难题,难的是把一整件事连续做完(来源:墨奇 WRC 报道 2026-08-21)。
任务连续性成为今年 WRC 上值得关注的技术信号——比起单独展示抓取或折叠,把机器人放进一个足够长、足够复杂的任务中,看它是否能一路执行到底。
2026 年 8 月 19 日,「具身数据底座」开始公开发售,首发价 5100 元(来源:36 氪系 2026-08-19)。
这件事的标志性意义在于:具身数据开始从「公司内部能力」变成「可买卖的基础设施」。当数据底座有了标准化的产品和价格,意味着**「采什么数据、怎么采、采多少」开始从研发问题变成采购问题**。
回头看 WRC 2026,具身公司「老实」下来不是认输,是认清了战场在哪。
两年前,行业习惯把具身智能理解成「给大模型装上一副身体」:摄像头负责看,关节负责动,灵巧手负责执行,所有人的注意力都放在「大脑」上。今年发现,身体反过来卡住了大脑——最后几厘米的偏差、接触瞬间的滑移、不同杯子的摩擦力,都无法从语言和互联网视频里直接长出来。
王兴兴的 IPO 给行业打了鸡血,宇树市值冲到 3400 亿。但王兴兴自己清楚,单靠模型能力堆不出 3400 亿对应的产品。他今年的演讲主题之所以叫「从展品到产品」,是因为他知道下一步的增长点不在模型上,在数据上。
具身智能的 GPT-3 时刻不会来自某个模型突破,而会来自一条数据管道的成熟。
这条管道现在还在打地基:有人在做无本体数采的头环,有人在做真机遥操的力反馈手套,有人在做 sim-to-real 的合成数据,有人开始卖 5100 元的数据底座。
WRC 2026 之后,具身行业的竞争不再是「谁的 VLA 更准」,而是「谁的物理世界数据更多、更真、更能用」。
这才是今年世界机器人大会真正「卷」起来的地方。