英伟达多伦多实验室日前开源了Kimodo,一个能够从自然语言生成全身3D人体与人形机器人动作的扩散模型。用户只需用一句话描述动作意图,例如"一个人弯腰捡起地上的球",Kimodo即可生成对应的全身骨骼动画,并且支持关键帧、足部目标、运动路径等运动学约束,让生成结果贴合具体场景需求。最受关注的是其轻量特性:单张RTX 3090显卡甚至仅3GB显存就能运行,大幅降低了3D动作生成的使用门槛。
动作生成是3D内容生产中最耗人力的环节之一。传统流程中,动画师需要手动逐帧调整骨骼姿态,或者依赖昂贵的动捕设备录制真实动作;即便是参数化方法,也需要针对每个动作重新优化。Kimodo的思路则是用扩散模型直接学习"文字描述与动作序列"之间的映射关系:模型在海量标注动作数据上训练后,能够把自然语言的运动语义解码为连贯的全身骨骼动画。
Kimodo的扩散架构使其天然具备多模态条件能力。除了文字描述,模型还接受关键帧约束,指定某个时刻的特定姿态;足部目标约束,控制双脚与地面的接触关系;以及路径约束,规划角色在空间中的移动轨迹。这些约束可以单独使用或组合使用,让创作者在自由生成与精确控制之间取得平衡,既保留扩散模型的多样性与创造力,又满足工业场景对可编辑性的要求。
值得强调的是,Kimodo面向的不仅是人类角色。模型支持生成人形机器人动作,输出可直接用于机器人仿真环境中的运动测试。英伟达将其定位为连接"语言理解"与"物理运动"的桥梁,期望它在具身智能训练、动画制作、游戏开发与影视预演等场景中发挥作用,为虚拟角色与实体机器人提供统一的动作生成底座。训练数据层面,模型覆盖了跑步、跳跃、搬运、交互等常见行为类别,并对中文描述做了专门适配,中文用户可以直接用自然语言生成动作,无需切换语言习惯。官方同步提供了覆盖各场景的示例提示词库,新用户可以快速上手,即便是零动画经验的创作者,也能在几分钟内生成第一段可用的动作序列。
Kimodo最让开发者兴奋的特点是硬件门槛极低。官方数据显示,模型可在单张RTX 3090显卡上流畅运行,推理所需显存低至3GB级别,这意味着普通游戏本、入门级工作站甚至部分嵌入式设备都能承载动作生成任务,无需专门的推理服务器。对于动捕工作室、中小游戏团队与机器人实验室而言,这种"一张显卡即可用"的特性,直接决定了技术能否从论文走向产线。
轻量化背后是模型结构与推理策略的精心设计。Kimodo在保证动作连贯性的前提下,对扩散模型的时间步采样与注意力机制做了针对性压缩,把单次生成的推理开销降到消费级硬件可承受的范围。官方还提供了配套的推理脚本与示例,开发者可以在GitHub上直接下载权重并运行,无需自行搭建复杂的训练管线。
从生态角度看,英伟达开源Kimodo延续了其"以开源模型培育生态"的一贯策略。动作生成模型的开源,能让更多开发者基于它开发应用:游戏开发者可以用它批量生成NPC动作,动画团队可以把它作为参考动作的起点,机器人团队则可以把生成的动作序列导入Isaac Sim等仿真平台进行物理验证。模型越轻量、越易用,接入生态的开发者就越多,英伟达的软硬件生态也就越牢固。生成质量方面,Kimodo输出的动作平滑自然,关节角度符合人体运动学规律,不会出现穿模、抖动等常见问题;若对某段动作不满意,用户可以微调提示词重新生成,或对关键帧做局部修改,迭代成本远低于传统动画制作。
在具身智能方向,Kimodo的价值在于为机器人训练提供海量、可泛化的动作数据。人形机器人的运动学习长期受困于真实数据稀缺,而Kimodo生成的合成动作可以覆盖各类日常行为,配合仿真环境中的物理反馈,帮助机器人策略在虚拟世界完成大规模试错,再迁移到实体设备。足部目标与路径约束的支持,更让生成动作天然适配地形与任务需求,缩短了从动作生成到策略训练的链路。
在内容生产方向,Kimodo显著降低了3D动画的创作门槛。过去需要专业动画师数小时甚至数天的工作,现在可以通过自然语言描述在几分钟内获得基础动作,创作者再在此基础上精修。对于独立游戏开发者、短视频创作者与虚拟偶像运营团队而言,这意味着动作资产的获取成本大幅下降,内容生产的节奏得以加快。
从行业趋势看,3D动作生成正沿着"文本生成、多模态控制、端侧运行"的路径快速演进。Kimodo的发布把动作生成模型的硬件门槛拉到了消费级水平,与去年以来3D资产生成、视频生成的普及浪潮形成呼应。随着类似模型的开源与迭代,虚拟世界的创作权正在被交还给每一个普通用户,而英伟达选择在这条赛道上持续播种,静待生态开花。官方还透露,后续版本将加入音频驱动的动作生成与多角色交互支持,进一步拓展输入模态与应用范围,动作生成与口型、表情等能力的融合有望让虚拟角色表达更加完整。