13万小时人类数据喂出Motus2,机器人插灯泡成功率84%

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

灵巧操作一直被视作世界模型进入物理世界最严苛的一道考验。9月10日,在2026外滩大会的一场见解论坛上,生数科技联合创始人兼CEO骆怡航正式发布面向机器人灵巧操作的自进化通用世界模型Motus2,项目页署名为生数科技的研究身份GensPI与清华大学,技术论文编号为arXiv 2608.30237。9月14日,团队通过新闻稿向全球披露了完整技术细节与真机评测结果。

Motus2要解决的问题很具体:大多数机器人系统把动作模块、世界模拟器与评估器拼装在一起,各自独立训练、彼此信息不通,导致机器人能预测结果却无法判断结果好坏。Motus2把动作生成、后果预测与结果评估塞进同一个共享参数的视频动作模型,试图让机器人在行动之前先看见未来,再判断这个未来值不值得走。

把策略、模拟器和裁判塞进同一个模型,闭环怎么跑

Motus2在一个统一模型里暴露三个控制接口。世界动作模型负责提出可执行的动作块;动作条件世界模型预测这些动作块会造成什么样的视觉后果;价值模型则对预测出的结果打分,供选择与学习使用。三者共用同一套参数,因此策略、模拟与评估之间不存在信息断层,这一点与把动作头外挂在独立模拟器上的做法有本质区别。

闭环在推理与训练两个阶段运行方式不同。推理时采用Best-of-N规划:模型一次采样多个候选动作,先想象各自会带来什么结果,再执行得分最高的那一条,之后机器人重新观察真实场景并规划下一步。训练时则利用候选动作的价值分数做策略更新,让模型更倾向于生成有利于完成任务的行动序列。关键在于更新范围:整个过程只更新与动作相关的参数,预测与评估部分保持冻结,避免反馈把已经学到的动力学知识冲掉。这个设计约束相当重要,因为世界模型一旦被自己的评估信号带偏,后续所有规划都会建立在失真的想象之上。

13万小时人类视频打底,机器人域中训把成功率从51%推到84%

数据体系遵循以人为中心的金字塔结构。底层是约13万小时第一视角人类操作录制,从单目到同步双目视频;其上叠加超过100小时的机器人轨迹与人机对齐数据。训练分阶段推进:先用单目视频学习物体变化与操作的宽泛规律,再用双目视频与人类动作数据学习空间关系与手物交互,之后进入机器人域中训,最后针对目标任务微调。

这组对比最能说明机器人域中训的价值:在同样的目标任务微调流程下,只用第一视角人类数据预训练的模型,在五项主要任务上平均成功率51%;加入机器人域中训后,这个数字提升到84%。人类数据提供的是宽泛的操作先验,机器人数据负责把这份经验对齐到机器人自身的观测与控制空间。团队还做了数据规模的验证,把双目视频从2000小时扩展到20000小时,持续降低留出集上的动作预测误差,说明这条数据路径仍有扩展空间。

Best-of-N先想后做,动作掩码挡住偷看未来的捷径

真机评测的结果给了这套机制一个相对清晰的刻度。在五项主要真实机器人任务上,包括放球、多指操作、粘贴橡皮、拧灯泡与放置手机,Motus2平均成功率达到84%,每项任务每种方法各做20次试验。在放手机与多指操作这两项更依赖精细接触的任务上,基础策略的平均成功率约为65%,只加推理时规划约为67.5%,只加基于模型的强化学习约为72.5%,两者叠加达到约75%。这个梯度说明规划与学习解决的是两类不同的问题,合并使用才拿得到最好的结果。

一个容易被忽略的工程细节是动作优先信息掩码。在视频加控制这类方案里,策略容易提前看到未来的视频词元,相当于在行动之前就偷看了答案,学到的关联在真实场景里并不成立。Motus2用掩码阻止策略在确定动作之前接触未来信息,从训练源头切断这条捷径。团队还处理了单帧视觉无法完全刻画的任务状态,引入历史信息保留机制,让模型在遮挡与多步操作中能够利用更早的任务线索,而不是只看当前一帧就做决定。

一个轻量触觉专家,让拉纸杯和撕纸从60%到72.5%

接触密集型任务对视觉来说是盲区。纸杯被拉出的过程、纸张被撕开的瞬间,关键信息藏在力与摩擦里,摄像头看不到。Motus2为此加入一个轻量触觉专家,它复用主干特征,只在每段短动作执行前读取最新的接触反馈并据此修正动作,不额外引入一套庞大的独立网络。

效果在两个真机任务上得到验证:拉出纸杯与撕纸的平均成功率从约60%提升到72.5%,提高12.5个百分点。硬件层面,演示覆盖双臂机器人平台搭配WUJI、WUJI Hand 2与Sharpa Wave等高自由度灵巧手,任务包括拧灯泡、双手撕纸、翻页、开饮料罐与寻找隐藏物体。团队对自进化的定义也保持了克制:它指的是通过模型预测与价值反馈来改进策略的具体机制,是限定任务内的早期递归自我改进循环,而不是开放环境中无约束的自主学习。这一表述与生数科技提出的世界模型L1到L5五级演进路线相呼应,Motus2探索的正是从L3在世界中行动走向L4自主世界智能体的关键跨越。

素材来源:美通社、Pandaily、和讯科技、RobotToday 发布时间:2026-09-15