把一段手机随手拍下的视频变成可以自由旋转、驱动的3D化身,这项曾经属于专业动捕团队的能力,正在被一套开源技术拉进普通开发者的视野。近日,浙江大学与蚂蚁集团联合推出4DAnyone技术,它能够将手机拍摄的单目视频直接转换为可查看的动态3D化身。针对多视角重建中长期存在的面部漂移问题,4DAnyone通过RCP压缩技术与TCR跨批次结构传递两项创新给出了解决方案,并支持身份在不同角色间的迁移。在数字人、游戏、电商等对3D内容需求爆发的当下,4DAnyone让"一段视频生成3D化身"从专业门槛走向大众可用,也为国产AI 3D技术阵营再添一个亮眼成员。
传统的高质量3D化身生成,通常依赖多机位同步拍摄或专业动捕设备,成本高、门槛高,普通用户几乎无法触及。近年来基于多视角重建的AI方法虽有进展,但普遍要求用户在拍摄时保持固定姿势、多角度采集,操作复杂且容易失败。4DAnyone的突破在于,它只需一段手机拍摄的普通单目视频,就能重建出可查看、可驱动的动态3D化身,大幅降低了3D内容生产的技术门槛。
技术难点的核心在于"时间一致性"。当一段视频中的人物持续运动,模型需要从每一帧中提取身份信息并保持统一,而逐帧重建往往会导致面部特征漂移、细节不稳定。4DAnyone用两项关键技术回应了这一挑战:RCP(参考压缩)技术将随视频长度线性增长的参考数据压缩至固定预算,让模型在有限算力下处理长视频;TCR(时序一致性重建)技术则跨批次传递结构信息,将批次间的身份特征对齐,有效对抗了批量多视图重建中常见的面部漂移问题。两项技术叠加,让"一段视频、一个化身"成为稳定可用的现实。
4DAnyone的能力不止于"还原"一个人的3D形象,还支持身份在不同角色间的迁移。这意味着用户可以用自己的视频生成基础化身,再将其身份特征映射到其他角色形象上,创造出"换了形象、保留特征"的个性化数字分身。这一能力在游戏角色定制、虚拟偶像孵化、电商虚拟试穿等场景中具有广阔的应用空间,为创意生产提供了新的可能性。
当然,作为一项快速演进的技术,4DAnyone也有其能力边界。当前方案更适用于单人、单段视频的化身重建,复杂场景、多人交互、极端动作的鲁棒性仍有待提升;生成精度与专业级扫描建模相比也存在差距。不过,考虑到它只需一段手机视频的输入成本,这种"够用且便宜"的定位恰恰符合当前3D内容爆发期的市场需求。随着浙大与蚂蚁方面后续的开源发布与迭代,其能力边界有望持续拓展。
从实现细节看,4DAnyone对算力的要求也相对友好。得益于RCP技术将参考数据压缩至固定预算,模型的显存占用与计算开销不会随视频长度线性增长,普通消费级显卡即可运行推理,这让中小团队和个人开发者也能负担得起3D化身生成的算力成本。开源策略方面,浙大与蚂蚁选择公布技术方案与代码,意味着全球开发者都可以在此基础上二次开发,围绕4DAnyone的衍生应用与工具链有望快速丰富,进一步降低3D内容创作的门槛。
4DAnyone的发布,让本已热闹的国产AI 3D赛道再添新兵。今年以来,国产3D生成工具持续迭代:VAST推出Tripo P1.0原生网格模型,影眸科技发布Rodin Gen-2.5并获数亿元融资,腾讯混元3D开源Buffalo统一三维多模态模型,鹿客联合红象科技发布家庭空间世界模型Moldia。与这些面向专业创作的工具不同,4DAnyone聚焦"视频转3D化身"这一垂直入口,与现有工具形成了差异化互补。
从技术路线看,4DAnyone走的"单目视频重建"路径,恰是降低3D内容门槛的关键方向。相比文字转3D、图片转3D,视频天然包含多角度、多姿态信息,为重建提供了更丰富的几何与纹理线索,也更贴近用户已有的内容资产。当手机视频就能生成可用化身,3D内容的供给瓶颈有望被显著缓解,而围绕数字人直播、虚拟试穿、游戏UGC等场景的落地应用,也将随之加速。浙大与蚂蚁的这次合作,既是一次学术创新,也是国产AI 3D技术向消费级场景渗透的重要一步。
3D化身生成技术的商业化前景,正在多个场景同步展开。在数字人领域,低门槛的3D化身生成让虚拟主播、数字分身从企业级工具走向个人创作,创作者可以用自己的形象快速孵化数字分身;在电商领域,3D化身驱动的虚拟试穿、虚拟展示,有望成为提升转化率的新手段;在游戏领域,玩家自定义角色与UGC内容创作,需要大量低成本、高质量的3D形象资产,4DAnyone类技术恰好填补了这一空白。
值得注意的是,3D化身技术的大众化也伴随着数据与伦理议题。个人形象的数字孪生涉及肖像权保护,深度合成内容需要符合标识合规要求,这些都需要在技术普及的同时建立配套规范。从产业视角看,4DAnyone的意义在于证明"低门槛3D化身生成"在技术上是可行的,而如何把技术转化为可靠、合规、可规模化的产品,将决定它能否真正撬动3D内容生态的变革。对于国产AI 3D阵营而言,这既是机会,也是新的考验。
从技术路线演进看,视频转3D还有更深的想象空间。当化身生成解决之后,下一步是"化身驱动"与"场景融合":让生成的3D化身无缝嵌入虚拟场景,配合动作生成、表情驱动、语音同步等技术,形成完整的数字人生产链路。浙大与蚂蚁的团队背景也为这一方向提供了支撑,前者拥有扎实的计算机视觉与图形学研究积累,后者则具备大规模应用落地的工程经验,产学研结合的模式,有望让4DAnyone从学术成果快速走向实际产品。