10 万小时,砸出一条机器人赛道的工业化之路
发布于 2026-07-18
小米用 10 万小时真实轨迹预训练 Xiaomi-Robotics-1,参数与数据两轴同时验证机器人 Scaling Law,进厂打螺丝成功率 98%——具身智能的工业化门槛被中国公司正面撞开了。
10 万小时,砸出一条机器人赛道的工业化之路
2026 年 7 月 16 日,小米发布了第二代具身基座模型 Xiaomi-Robotics-1。这家公司用它喂了10 万小时真实世界操作轨迹,预训练完成后下游任务随之稳定改善——这是国内第一次在机器人策略模型上,对 Scaling Law 做了系统验证。
机器人想要复刻 ChatGPT 的奇迹,被卡在数据上整整十年。小米用中国人自己的方式,打开了这条死结。
一、为什么机器人走不了 LLM 那条 Scaling Law
先把问题说清楚。
LLM 这两年进步神速,核心秘诀只有一条:数据越多,模型越大,算力越猛,能力就越强。 这条规律叫 Scaling Law,OpenAI 从 GPT-2 堆到 GPT-5,每一代都在按这条曲线走,背后是互联网上万亿 token 的语料。
机器人也想走这条路。但十年下来,没人能走通。
因为机器人需要的"互联网",根本不存在。
训练 ChatGPT 的数据可以从公共网页爬,成本可控。但要训练机器人去抓杯子、整理桌面、拧螺丝,需要的是真实世界的操作数据。一台机器人、一个操作员、一天能采到的轨迹就那么多。换个机械臂、换个相机位置,同一段任务的数据分布就变了,原来的数据直接作废。
每换一个平台就得重新来。规模化?想想就别想了。
这个死结困住了整个行业十年。所有人知道"数据越多越好",但就是凑不够。凑不够,就没法做规模实验,没法验证规律,没法预测下一代能涨多少。大家都只能在单任务上调参、做 Demo、写漂亮的指标,然后改改改。
小米的破局,发生在数据来源这一环。
二、把"人如何改变世界状态"录下来
Xiaomi-Robotics-1 的 10 万小时预训练数据,不是来自机器人本体,而是来自人手操作的轨迹。
具体怎么做?小米自研了一台叫 UMI(Universal Manipulation Interface)的便携采集设备。它的妙处在于不绑定任何特定机器人。人拿着它就能在各种真实场景里录操作轨迹——家里、办公室、商场、户外,工业产线也行。
然后是一条 VLM 自动标注流水线。10 万小时数据让人工一帧一帧标注,慢得让人绝望。小米的做法是:把长轨迹切成固定片段,让视觉语言模型自动识别每个片段里夹爪状态、物体状态的变化。
模型训练的目标不再是"模仿动作",而是"理解状态变化"——从"这一步夹爪往左 2 厘米",变成"把桌上的杯子放进柜子里"。

到这里,规模化第一次有了可能。
实验数据印证了这条路:预训练数据从 2,500 小时扩到 20,000 小时,模型在验证集上的动作预测损失持续下降;参数规模从 20 亿扩到 50 亿、再到 100 亿,动作预测能力同样稳定改善(来源:小米 Xiaomi-Robotics-1 技术披露,2026-07-16)。
数据维度和参数维度,两个轴同时验证。Scaling Law 在机器人策略模型上第一次跑通了。
数据本身,是机器人赛道被忽略的那条主轴。小米做的不是模型创新,是底层原料的工业化。
三、从手工作坊到工业化 2.0
这个曲线意味着什么?
意味着机器人第一次有了"开箱即用"的底座。
传统做法是每个新任务都得从头训一个模型,或者用一个基础模型在每个客户场景里做几十次微调。这条路线对应的是 LLM 早期——每个公司都有自己的小模型,谁也通用不起来。
而小米这次发布的 Robotics-1 是基座模型。它的目标不是完成某一个具体任务,而是让下游开发者,不用从零造轮子。
