人类 100 分,最强模型 12.8 分——RoboDojo 把机器人的底裤扒了
胡新宇
Published on 2026-07-09
独立学术联盟 RoboDojo 发布具身智能统一评测:真机成功率最高 12.8%、人类 100%,开放语义任务集体塌方到 1.67%。demo 视频时代结束。
人类 100 分,最强模型 12.8 分——RoboDojo 把机器人的底裤扒了
通用机器人的临门一脚,幻觉先碎了。
2026 年 7 月 8 日,量子位报道了一个叫 RoboDojo 的基准发布。它的数据摆出来很扎眼:真机评测里表现最好的模型 π0.5,总体成功率 12.8%;仿真最强 Hy-Embodied-0.5-VLA,成功率 8.80%。人类专家在真机上的成功率是 100%。最强模型在开放语义任务上的成功率,只有 1.67%(量子位转述 RoboDojo 论文 / arXiv:2607.04434)。
这不是又一个"自家模型自家测"的 benchmark。它背后站着港大 MMLab 和北大的学术联盟,治理方是公益组织 AI MMLab Club 基金会,没有商业模型方在出题。换句话说,这是一份独立出题人给全班考生出的考卷,30 个主流机器人策略同台竞技。
一年前,"叠碗、插管、倒水、整理桌面" 的 demo 视频刷屏,让很多人产生错觉:通用机器人快来了。RoboDojo 的回答是——快了,但远没有宣传的那么快。
RoboDojo 到底在测什么

具身智能的评测过去一年乱得很。每家厂商自己拍视频、自己定义任务、自己宣布 95% 成功率。没有统一的试卷,再牛的分数也没法横向比。
RoboDojo 想做的就是那张试卷。它把机器人操作能力拆成五个核心维度:
- Generalization(泛化):能不能适应新背景、新光照、新物体和杂乱场景。桌面杂物最多可随机到 25 个。
- Memory(记忆):能不能记住传送带上出现又消失的物体,再从后续候选里把它挑出来。
- Precision(精细操作):能不能完成插管、对齐、精确接触。偏一点点就算失败。
- Long-Horizon(长程):能不能连续完成多步骤、强依赖、误差会累积的任务。
- Open(开放语义):能不能理解没见过的开放指令,把"把那个红色杯子放到左边"变成动作。
仿真里给了 42 个任务,真机上给了 18 个任务。真机采用 ARX X5、Piper、Piper X 三种双臂平台,每平台 6 个任务。每次测试前评测人员按预设布局复现场景,每个 trial 由三名评审双盲打分,既看最终成功,也看中间步骤完成情况(量子位 / RoboDojo-RealEval 协议)。
这套设计直接戳穿了 demo 视频的两个套路:演示任务是精心挑过的,演示环境是精心布置的。RoboDojo 把这两个精心都拿掉,剩下的就是真本事。
最狠的是,它把所有外部流程——数据格式、预处理、训练脚本、动作表示、部署环境——交给了一个叫 XPolicyLab 的统一接入层做标准化。30 个策略通过这个接入层公平比较,工程成本从"各家各自适配"降到"一次接入,多处评测"(XPolicyLab GitHub)。
这是 RoboDojo 真正的硬核之处:它不只是一张试卷,还是一套让机器人圈能持续互相比较的基础设施。
12.8% 背后的三个真相

真相一:头部策略都不"全能",短板极明显
榜单第一 Hy-Embodied-0.5-VLA 平均分 13.07,第二名 Spatial Forcing、π0.5、X-VLA、GR00T-N1.7 等紧追,但都在个位数到十几分之间。