π0.7 把通用机器人送过了 GPT-3 时刻
Site Owner
发布于 2026-07-29
π0.7 第一次在机器人领域证明组合泛化:没训过的空气炸锅,组合已有技能就能烤红薯;叠 T 恤任务通才追平 375 小时经验的人类操作员。论文里的洞见简单到反直觉——数据标签比数据清洗更重要。
π0.7 把通用机器人送过了 GPT-3 时刻
2026 年 4 月 16 日凌晨,Physical Intelligence(PI)发布了新一代机器人基础模型 π0.7。研究员 Ashwin Balakrishna 在 X 上说了一句不太像 PR 的话:"我过去总能根据训练数据猜出模型能做什么。这一次,我猜不到了。"
这句话比所有 demo 视频加起来都重要。它意味着具身领域第一次遇到 GPT-3 当年遇到的事——模型跨过了某个阈值,能力开始非线性地从训练数据里涌现出来,作者自己都摸不到边界。

通才追平专才
判断一个模型是否进入"涌现时刻",不需要看参数,看一件事就够:没做过专项训练,能不能打过专项训练过的专家。
π0.7 给的答案是:在做咖啡、叠衣服、装箱三个最复杂的家务任务上,开箱即用的通才版本追平甚至超过了 π0.6 经微调的专家模型。这里的"专家"不是花拳绣腿——RL specialist 用 RECAP 方法针对每个任务单独训过,SFT specialist 也针对每个任务做过监督微调。
最狠的一项数据是叠 T 恤。π0.7 的训练数据里一条 UR5e 叠衣服的样本都没有,但任务完成度 85.6%。对照组是 10 个平均有 375 小时 teleop 经验的人类顶级操作员,他们的成绩是 90.9%。基本打平。(来源:π0.7 论文 + 量子位 https://www.qbitai.com/2026/04/402189.html)
PI 联合创始人 Chelsea Finn 在转帖里把这件事和 LLM 的历史做了对比:"大语言模型的后训练,过去指的是针对下游任务做微调。一直以来,机器人也卡在这个阶段,想要最好的性能,就得针对具体任务微调。π0.7 改变了这一点:开箱即用,而且超过了 fine-tuned 的专家模型。"
这就是 GPT-3 时刻的特征。GPT-2 时代 NLP 也要每个任务微调,GPT-3 证明 zero-shot/few-shot 就能追平甚至超过微调模型,NLP 的玩法从此换成提示工程。π0.7 在机器人身上做了同样的事。
怎么做到的——不是新架构
绝大多数人会猜 π0.7 提出了什么新架构。论文里明明白白写了:"我们的贡献是提出了一套让 VLA 能使用更多样化数据源的方法论——不是新的架构或模型设计。"
π0.7 是一个 5B 参数的模型,分三块(架构数据来自 π0.7 论文):4B 参数的 Gemma 3 做视觉语言骨干;860M 参数的 transformer 用 flow matching 生成连续动作 chunk;一个从 14B 的 BAGEL 图像生成模型初始化的 world model,负责画出"下一秒画面应该长什么样"。
架构和 π0.6 没有本质差别。差别在 prompt。
过去 VLA 训练只喂一句"清理冰箱",模型得到的信号是单一的。π0.7 把 prompt 展开成四层:任务指令(清理厨房)+ 子任务指令(打开冰箱)+ 子目标图像(下一秒画面应该长什么样)+ episode 元数据(这条数据质量几分、有没有出错、速度多快)。
四层 context 加进去之后,模型就能分得清训练数据里的好坏、快慢、对错。然后它就能吃下以前吃不了的数据——失败的 rollouts、低质量的演示、其他机器人的片段、人类的 egocentric 视频,全都变成有用的信号。
多样数据本身不是问题,问题是模型不知道自己在学什么。 π0.7 加的那层 prompt,就是让模型知道"这段数据是什么质量、用什么策略做的"。
数据清洗可能是个伪问题
论文里藏着一个反直觉的实验。
研究把叠衣服的数据按质量分四档:top30%、top50%、top80%、全部数据。然后分别训两个版本的 π0.7,一个加 metadata(每条数据打上质量几分、有没有出错、多快完成的标签),一个不加。
不加 metadata 的版本,数据越多,性能越差——因为混入了低质量数据把模型带歪了。
加了 metadata 的版本,数据越多,性能越好——哪怕平均质量在下降。
整个具身领域过去几年都在做的"数据清洗",可能是个伪问题。只要模型知道每条数据的质量标签,它就能自己决定要学什么、不学什么。
垃圾数据不再是垃圾,是带着 quality=1/5 标签的有用信号。失败数据也不是要丢掉的东西,是告诉模型"这么干会失败"的反面教材。

这个判断如果成立,意味着过去三年具身公司砸重金搭的清洗流水线,从长期看是在优化一个会过时的环节。自变量 CEO 王潜说过:"以前 80% 的工作在模型算法上,现在 80% 的工作在数据上。"π0.7 在说:数据工作的形态会从"挑数据"变成"标数据"。
世界模型派被基线吃掉了
π0.7 的核心作者之一是 Lucy Shi,斯坦福博士生,师从 Chelsea Finn。
她之前在英伟达跟着朱玉可、Jim Fan 做世界模型。她押的注和 PI 相反——世界模型会是关键的钥匙,会在任务泛化上显著超过标准 VLA 方法。
一开始,结果确实支持这个假设。她拿到了惊艳的组合泛化,机器人能遵循没见过的指令,做训练数据里没有的任务,从其他机器人和人类视频迁移。
但有个奇怪的事情发生了——他们拿来对比的 VLA 基线,一直在变强。
随着数据越收越多,VLA 越来越强,直到有一天,VLA 基线也开始展示出组合泛化的信号。而且,VLA 的方法简单得多。
Lucy 在推特上发了一条 thread:"当你的基线吃掉了你的研究假设,你能怎么办?你写一篇论文,去搞清楚基线为什么这么强。"
那篇论文,就是 π0.7。
这件事的杀伤力不在 PI 赢了英伟达,而在于——一条被认为必要的工作流(先让模型学会想象世界再去操作),可能从来就不是必要的。VLM 可以直接控制机器人,不需要先学会想象世界。
去年 Cosmos 带起来的世界模型风潮,吸引了最多的注意力和投入。今天风向又要变了——VLA 回来了。
接下来三年具身领域会怎么变
把这件事放回 GPT-3 当年的类比里,能看见接下来三年的几个变化。
第一,模型的差异化让位于数据标签体系的差异化。当通才能追平专才,模型本身的边际收益在递减。真正决定下一代模型能力的,是谁能搭出更好的"prompt + metadata + 多源数据"流水线。这条流水线是软件工程问题,不是 AI 研究问题。
第二,仿真数据、人类 egocentric 视频、其他机器人的数据,从"噪声"变成"信号"。前提是数据得带正确标签。这给具身数据基础设施留出了一个巨大的赛道——智域基石这类做"数据编译"的公司,做的就是这条线上的工具(来源:机器之心 https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651028221)。
第三,世界模型不会消失,但会换位置。它不再充当 policy 的核心,而是降级成消歧器——像 π0.7 里那样,把任务指令翻译成"成功那一帧应该长啥样",不预测动作后果,不参与决策链路。用世界模型派的武器,干了一件不是世界模型派想象的事。
不是"机器人要 AGI"
这条阈值被跨过之后,外界的反应会两极分化。
一端会把它读成"机器人要 AGI 了"——这没读对。π0.7 的 demo 全是家务场景,离通用智能还很远。跨过的是"通才追平专才"这一条具体阈值,不是 AGI 那条更大的阈值。
另一端会把它读成"VLA 路线赢了世界模型"——这也没读对。π0.7 自己就内嵌了一个 world model 做消歧器。真正的变化是世界模型不再充当规划器,而是降级成辅助模块。
读对的反应是:一个具体工程问题(怎么让 VLA 吃多样化数据)被解决了,而工程问题被解决,恰好就是涌现时刻来临前的必要条件。
2018 年 BERT 把预训练 + 微调做成 NLP 的标准流程,没人叫它 GPT-3 时刻,但 GPT-3 那天的所有地基都是 BERT 铺的。π0.7 在做的事,性质上更像 BERT——给后面的涌现时刻铺地基。区别在于它直接让一个模型把涌现做出了肉眼可见的迹象。
赌一下接下来 18 个月:VLA 路线主导具身研究投入;世界模型派要么转去做 policy 的辅助模块,要么得证明自己在数据效率上有 VLA 看不上的优势;做"数据标签 + 多源数据集成"基础设施的公司,会比做模型本身的公司更被资本追逐。
具身领域从来不是模型问题,是数据问题。π0.7 没改变这一点,它只是让大家第一次看清了这一点。
参考来源
- π0.7 官方博客:https://www.pi.website/blog/pi07
- 量子位:https://www.qbitai.com/2026/04/402189.html
- 机器之心:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651028221
- TechCrunch:https://techcrunch.com/2026/04/16/physical-intelligence-a-hot-robotics-startup-says-its-new-robot-brain-can-figure-out-tasks-it-was-never-taught/