人形机器人领域的竞争,正在从走路、搬东西的表演赛,升级为真刀真枪的对抗演练。宇树科技9月7日对外发布新一代世界模型UnifoLM-X2-1.0,并用一段人形机器人全自主实时格斗的视频震惊业内:两名机器人不再依赖任何人工操控或预设脚本,而是凭借自身对环境的理解完成攻防、闪避与反击,动作衔接流畅,反应速度贴近真人对抗。官方称这是世界模型驱动物理交互的一次重要突破,也让人形机器人的自主决策能力接受了一场最直观的压力测试。
演示视频发布后迅速在社交平台刷屏,不少观众感叹画面中的攻防节奏已接近真人对抗,出拳速度与闪避反应都超出人们对机器人笨重迟缓的刻板印象。有工程师逐帧分析指出,机器人在被击中后能迅速调整重心并改变战术,说明其决策并非简单的预设动作拼接,而是基于实时感知的动态规划,这正是世界模型区别于传统控制算法的核心所在。
从宇树公布的演示画面看,两名机器人在擂台上你来我往,出拳、格挡、侧身闪避一气呵成,偶尔被击中后能迅速调整姿态重新投入对抗,整个过程没有外接摇杆与预录动作的痕迹。官方强调,这段演示由UnifoLM-X2世界模型在端侧实时驱动,机器人通过摄像头与传感器感知对手动作,在毫秒级时间内预测下一步态势并生成相应运动指令,属于真正意义上的自主决策而非编排表演。
为了让读者理解其中的技术含量,不妨对比此前的行业现状。市面上多数人形机器人的运动控制仍依赖工程师手工编写的行为库与状态机,遇到预设之外的场景往往束手无策,而世界模型试图让机器人像人类一样,在脑中建立对外部世界的动态预测,先推演再行动。宇树此次把格斗这种高速、强对抗场景作为展示窗口,等于主动选择了难度最高的考题,一旦跑通,说明模型对动态环境的适应能力已经具备相当的鲁棒性。
据宇树科技介绍,UnifoLM-X2-1.0在上一代基础上主要强化了三项能力。一是动态场景预测,模型不再只理解静态物体,而是能持续追踪对手的运动轨迹并预判其意图,这是格斗中完成闪避与反击的前提;二是端侧实时推理,团队通过模型压缩与推理加速,把决策延迟压缩到满足对抗需要的水平,避免大脑反应跟不上身体的尴尬;三是全身协同控制,格斗要求手臂、躯干与腿部动作高度配合,模型输出的指令直接映射到全身数十个关节的力矩分配。
训练数据的获取同样是难点。真实机器人对抗的数据昂贵且稀缺,宇树采用虚实结合的训练路线,先在仿真环境里让机器人自我对抗数百万回合,再通过域随机化把仿真策略迁移到实体机器人上,最后用少量真机数据微调。这种先虚拟后现实的训练范式,大幅降低了数据成本,也让机器人在训练阶段就能见识海量攻击套路,面对真人级别的出拳节奏不至于手足无措。
宇树还在技术说明中透露,格斗场景对运动控制提出了远超行走与搬运的挑战,机器人需要在高速运动中保持动态平衡,同时协调手臂与腿部的发力顺序,稍有不慎就会摔倒失分。团队为此重构了底层运动控制器,把世界模型输出的高层意图与关节级的力矩控制结合起来,让大脑的决策能够精准转化为身体的动作,这套软硬协同的架构也是此次演示能成功的关键。
格斗演示的观赏性固然抓人眼球,但产业界更关心的是技术能否迁移到实际场景。宇树科技回应称,格斗只是UnifoLM-X2能力的压力测试,模型核心的动态感知、实时决策与全身协调能力,可以直接复用到更贴近生产的任务上,比如在复杂产线上躲避移动的机械臂、在仓库里灵活分拣流转货物、在抢险现场跨越不稳定地形等,凡是要求机器人在不可预测环境中快速反应的应用,都能从这次技术升级中受益。
从行业格局看,宇树选择以格斗形式展示世界模型,也是一次精心设计的技术营销。人形机器人赛道从来不缺参数与概念,缺的是让公众一眼看懂的能力证明,格斗对抗的直观性与冲击力,恰好把抽象的世界模型能力具象化,视频在社交平台迅速传播,让宇树的技术形象再次出圈。与此同时,竞争者也已感知到压力,多家机器人公司近月陆续公布世界模型相关进展,围绕具身智能大脑的竞赛正在肉眼可见地加速。
这种能力迁移已经在宇树的落地场景中初见端倪。据官方介绍,基于UnifoLM-X2的机器人在工厂产线上能主动避让突然出现的作业人员,在物流分拣中能应对货品滑落等突发状况,在家庭环境中也能对移动的宠物与儿童保持安全距离,动态感知与快速决策带来的鲁棒性,正在把机器人的应用边界从结构化场景推向真实世界的开放环境。
尽管UnifoLM-X2的表现令人振奋,但行业仍需保持冷静。一次成功的格斗演示,距离机器人在家庭、工厂大规模服役仍有相当距离,续航、成本、安全性与长时间运行的可靠性都是待解的课题。宇树方面也坦言,世界模型解决了自主决策的大脑问题,但机器人产业是系统工程,关节电机、传感器、电池与本体结构每一环都不能掉队,公司将持续投入推动软硬件协同进化。
把视线拉长,2026年的具身智能行业正处在一个微妙的时间点,模型能力快速跃升,硬件成本稳步下探,资本热度居高不下。宇树此次以格斗形式秀出世界模型肌肉,既是对自身技术路线的一次自信展示,也是对整个行业的又一次提醒:人形机器人的竞争焦点,正在从会不会动转向会不会想,谁能率先让机器人在真实世界中做出聪明决策,谁就有机会定义下一代机器人的形态与用途,而这场竞赛的终局,远不止擂台上的胜负。
对于关注具身智能的普通公众而言,这段格斗视频最大的意义或许在于具象化了一个趋势,机器人正在从执行固定程序的工具,进化为能感知、能预判、能自主应对变化的智能体。随着世界模型、仿真训练与硬件成本的同步成熟,这样的人形机器人走进工厂、仓库乃至家庭的时间表,正在被一步步拉近,而宇树此次的演示,无疑为这个进程写下了一个让人印象深刻的注脚。