英伟达开源MotionBricks动作大模型,2毫秒实时生成35万种动作

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

动画制作与人形机器人控制,正在被一个开源框架拧成同一条技术线。英伟达近日开源了MotionBricks,一个覆盖35万种动作技能、以15000FPS实时生成、延迟仅2毫秒的动作生成基础模型。这个被官方称为"颠覆30年传统技术"的项目,核心是一个只有224M参数的神经骨干,却通过多码本量化的设计,把大规模动作生成压缩进了极小的模型里,实现无需动捕、无需骨骼绑定的实时动作生成。MotionBricks是英伟达GR00T Whole-Body Control机器人方案的核心组件,官方演示展示了它在宇树G1人形机器人上的实时控制,同一套运动生成能力,既用于动画创作,也用于机器人整机控制,代码采用Apache 2.0协议开源,预训练权重采用NVIDIA Open Model License。

224M参数覆盖35万种动作:多码本量化的小模型魔法

MotionBricks最反直觉的地方,是它用极小的模型撑起了极大的能力面。按照传统思路,要覆盖35万种动作技能,往往需要大规模数据和超大模型,而MotionBricks通过多码本量化技巧,把潜在表征拆分进并行的码本中,让224M参数的模型具备了覆盖35万种技能的能力,并在新场景中展现出零样本泛化。论文被ACM Transactions on Graphics接收,并在SIGGRAPH 2026上亮相,其架构分为Root模块、Pose模块和Motion Decoder三层:Root模块先确定动作时长与根轨迹,Pose模块沿轨迹安排身体姿态,Decoder再把紧凑的动作表示还原为逐帧的关节位置、旋转与脚步接触状态。

这种"先定路线、再排动作、最后补细节"的分步设计,解决了动作生成中"准确到达目标"与"动作自然"之间的矛盾。同一条前进轨迹可以配上正常走、潜行、僵尸步态、爬行等完全不同的身体动作,模型不会在可控性与自然度之间顾此失彼。官方在RTX 5090上实测,MotionBricks能在15000FPS下实时运行,延迟低至2毫秒,这意味着创作者可以在交互式环境中即时切换动作风格,边看边调,动作生成从"离线渲染"进入了"实时预览"的新阶段。

零动捕零绑定:动画工作流的一次范式更替

对动画与游戏行业来说,MotionBricks带来的冲击是结构性的。传统动作生产高度依赖动捕棚、动捕服与骨骼绑定流程,一个动作资产从采集、清洗到绑定往往要耗费数周,成本动辄数十万元。MotionBricks把这些环节全部省略,直接用文本或稀疏姿态关键帧就能驱动角色生成连贯动作,零动捕、零绑定的特性让中小团队也能获得接近工业级的动作生产能力。官方路线图显示,完整版将把模型嵌入GR00T Whole-Body Control方案并补齐训练管道,计划在首发约一个月后交付,届时开发者将能基于自己的动作语料库训练专属模型。

从技术细节看,MotionBricks还提供了智能基元,让新场景无需重新训练即可创作,这进一步降低了使用门槛。当然,它的边界也同样清晰:跨身体比例的动作适配仍会牺牲速度换质量,非人形角色效果有限;35万种动作对罕见动作类型覆盖不足;演示环境仅支持Linux与X11,且依赖CUDA GPU。它是一个纵深很窄但能力很深的工具,而不是包罗万象的通用模型,对于技术动画师、游戏工程师和宇树G1机器人研究者来说,它是当前最值得上手的动作基础件之一。

动画与机器人同一条线:GR00T生态的动作基石

MotionBricks的战略意义,远超动画工具本身。它把"运动生成"从逐任务训练加手工装配,推向"单一基础模型加即插即用",这一范式转变直接服务于英伟达的具身智能布局。作为GR00T Whole-Body Control计划的核心组件,MotionBricks与GEAR-SONIC管道搭配,为机器人提供运动先验,宇树G1演示提供了可复现的起点,机器人开发者不再需要为每个动作技能单独训练策略,而是可以直接调用MotionBricks生成的动作基元。这种"动画创作与机器人控制共用一套能力"的架构,正在缩短数字世界与物理世界之间的距离。

更深远的影响在于,MotionBricks把动作数据的生产从昂贵的人工采集,变成了模型自动生成。对于机器人训练来说,高质量、多样化的动作数据一直是稀缺资源,MotionBricks能在毫秒级生成35万种动作,意味着机器人可以在虚拟环境中以极低成本获得海量训练样本,再通过仿真到真实的迁移部署到实体。这也正是英伟达押注的方向:把物理AI的基础能力开源出来,让整个行业基于同一套动作语言构建应用,从而巩固其在具身智能技术栈中的生态位。当动作生成像大模型一样成为基础设施,动画、游戏与机器人行业的边界,也将随之变得前所未有的模糊。

从动画资产到机器人技能:动作数据的新供给

MotionBricks解决的另一层问题,是动作数据的稀缺性。在具身智能领域,高质量、多样化的动作数据一直是训练瓶颈:真人动捕成本高昂,采集的动作类型有限,而机器人需要的恰恰是海量、覆盖各种身体形态与场景的动作样本。MotionBricks以224M参数的模型覆盖35万种动作技能,配合自包含的合成训练管道,可以直接生成训练数据,摆脱对真人采集的依赖。官方数据集中包含BONES-SEED等大规模动作语料,模型在合成数据上训练后仍能保持泛化能力,这意味着动作数据的生产正在从"昂贵的手工采集"转向"廉价的模型生成"。

这种供给方式的转变,对动画与机器人两个行业都有深远影响。对动画师来说,动作资产的复用与迭代效率将大幅提升;对机器人研究者来说,MotionBricks提供的运动先验可以直接嵌入策略训练,配合仿真环境实现从虚拟到现实的迁移。当动作数据的生成成本趋近于零,制约具身智能发展的数据瓶颈将被显著缓解,这也是MotionBricks被纳入GR00T生态、并被视为物理AI基础设施的重要原因。

开源战略:英伟达的具身智能生态牌

MotionBricks的开源,延续了英伟达在具身智能领域的一贯打法:把底层能力开源,让整个行业围绕英伟达的技术栈构建应用。从Isaac Sim仿真平台到Omniverse数字孪生,再到GR00T机器人基础模型,英伟达正在搭建一个覆盖训练、仿真、部署全链条的具身智能生态,而MotionBricks补齐了其中"动作生成"这一环。代码采用Apache 2.0协议、权重采用允许商业使用的NVIDIA Open Model License,开发者可以免费使用、二次开发甚至商用,这种开放姿态的目的,是把尽可能多的团队拉进英伟达的生态体系。

从商业逻辑看,开源MotionBricks与其说是慈善,不如说是生态卡位。动作生成是具身智能的通用基础设施,谁定义了这套基础设施,谁就在后续的芯片、软件与服务销售中占据主动。通过开源降低使用门槛,英伟达可以迅速扩大MotionBricks的用户基数,让它在竞争中成为事实标准,正如CUDA在过去二十年里所做到的那样。对于开发者来说,选择MotionBricks意味着拥抱一个活跃的开源社区与完整的工具链;对于行业来说,动作生成基础设施的开源,将加速整个具身智能赛道的创新节奏,让更多团队能够站在同一块地基上向上生长。

素材来源:机器之心、量子位、智东西、英伟达官方博客 发布时间:2026-08-15