在第五届全球数字贸易博览会上,物理AI企业索辰科技与其战略投资企业杭州美梦空间科技联合发布了Physical-WAM物理世界动作模型与RoboTwin-Phys物理漂移评测基准。前者面向机器人对物理世界的理解、预测与动作生成,后者用于相关能力的评测与验证,两者构成一套模型能力加物理测评的闭环。美梦空间由北京大学信息技术高等研究院高文院士领衔的先进视觉系统研究中心孵化,今年8月,索辰科技完成了对它的独家种子轮战略投资。这次联合发布,把世界模型这条技术路线从论文推向了产品化的讨论场。
具身智能向前推进时,最先撞上的是训练信号的来源。计算机视觉与大语言模型获取样本的边际成本很低,网页文档、图片视频可以从互联网批量获取并标注。机器人的物理交互数据则完全不同:有效的样本诞生于真实或高保真仿真的接触过程,抓取、推拨、按压,每一次有效交互都伴随真机运动、接触反馈与物体状态改变。这类数据采集周期长,硬件损耗成本高,不同机器人本体之间还存在明显的数据迁移壁垒。
结果是机器人可用的真实物理交互样本仅维持在百万量级,与文本图像领域数十亿级别的数据体量相比,存在数万倍的落差。这个落差决定了机器人模型无法简单套用大语言模型的规模化路径。近期的一项评测也印证了这种能力缺口:有研究显示,最先进的视觉语言动作模型在标准静态测试中表现尚可,一旦引入空间布局偏移或时序外推等干预,成功率会出现明显下跌;另有研究指出,在接触丰富的任务中,这类模型存在精度失效与力失效两个相互独立的失效模式。用通俗的话说,模型知道看到杯子就该抓,却不知道杯壁有多薄、摩擦力够不够、注水后重心会不会偏。
面对数据供给的现实约束,美梦空间提出的解法是在感知信号输入与动作输出链路之间,插入一层物理Token表征。传统世界模型的中间表征是像素或隐空间向量,它可以推演物理世界的演化,但无法感知物理本身:知道下一帧画面会变成什么样,却不知道为什么会变成这样。对于只需要生成视频的任务,这已经足够;但对于需要动手的机器人,缺失的恰恰是原因这一层。
物理Token的作用是把不可直接观测的物理信息显式地表达出来。摩擦系数、物体重量、重心位置、接触状态这些量在图像里看不见,却决定了动作能否成功。把它们抽象成统一的表征之后,模型就有了一个可以推理与预测的对象,而不是只能从画面变化里反推。官方称Physical-WAM是首个具备物理感知能力的世界动作基模,基于可观测数据与深层物理数据训练,能在真实任务中实时觉察物理变化,并预判动作后果、实时修正行为。这类设计的价值在于它改变了模型的输出目标:不再是预测画面,而是预测物理状态的走向与相应的动作。
Physical-WAM由三个模块构成,形成感知、预测、生成到修正的反馈链条。PhysLens相当于物理翻译器,从多模态感知信号中提取摩擦、重量、重心、接触状态等不可直接观测的物理信息,输出统一的物理Token表征。这一步解决的是把视觉信号转换成物理变量的能力,相当于给模型装上了一层物理直觉,让后续的推理有据可依。
PhysDream负责在物理表征上推演未来状态,判断当前动作会导致什么样的后果,把可能发生的接触、形变与位移提前预演出来。PhysAct则把这些预演结果转化为具体的动作指令,并在执行过程中根据实际反馈进行修正。三者串起来,机器人从看到就做,变成先预测、再决策、后执行。这种闭环对接触丰富任务尤其重要,因为在这类任务中,动作的成功与否往往取决于执行过程中的细微调整,而调整的依据只能来自对物理状态的持续感知。
与模型同步发布的RoboTwin-Phys,是一个针对物理漂移的评测基准。它的意义在于把物理一致性从定性描述变成可量化指标。此前的机器人评测大多关注任务成功率,但成功率只能说明结果,无法解释失败原因。一个模型可能在标准测试里通过率很高,一旦物体重量或表面摩擦发生变化就迅速失效,这种脆弱性在单一指标下无法体现。物理漂移基准试图测量的,正是模型在物理条件变化时的稳定性。
建立基准的价值不仅在于排名,更在于给研发提供方向。当评测能够指出失败发生在感知、预测还是执行环节,团队就可以针对性地补数据或改结构。这也是为什么近一年世界模型赛道上评测工具密集出现:模型能力与评测标准是相互牵引的,没有可靠的测量方式,很难判断改进是否真实有效。对于正在从演示走向部署的具身智能行业,一套能够复现、能够横向比较的物理评测,可能比又一个新模型的发布更有实际意义。
当视觉语言动作模型的局限逐渐暴露,世界模型开始被当作具身智能跨越商业化门槛的新方向。逻辑并不复杂:如果机器人只能在见过的场景里模仿动作,那么每一个新场景都需要重新采集数据;而如果它掌握了物理世界的运行规律,就有可能把已有经验迁移到没见过的环境里。这正是世界模型试图提供的泛化能力。围绕这条路线,国内已经出现多条技术分支,有的从视频生成切入,有的从空间智能切入,Physical-WAM选择的是物理表征这一层。
不过从模型发布到规模化落地,中间仍隔着不少环节。物理Token的定义是否足够通用、仿真与真机之间的差距能否被有效弥合、评测基准能否被行业广泛接受,都需要时间检验。更现实的问题是数据闭环:物理世界动作模型的持续改进依赖真实交互数据,而数据的采集成本不会因为模型架构的进步而下降。因此这条赛道的竞争,最终可能不只是算法之争,也是数据采集体系与硬件部署规模之争。谁能同时把模型与数据管道跑通,谁才更接近真正的商业化。