用一句话描述一个游戏世界,然后让AI把它变成可以行走、探索、编辑的3D场景,这曾是生成式AI最诱人的愿景之一。8月6日,腾讯混元研究团队在arXiv发布论文并上线展示官网,推出WorldClaw,一个全智能体驱动的3D开放世界生成框架。与既往方法不同,WorldClaw不是简单地从文本渲染一张全景图,而是把文本提示转换为包含区域、地形、资产、材质与空间关系的结构化规格,再逐层构建出全局空间连贯、局部内容丰富、实例资产可编辑的大规模3D场景。
从技术路径看,WorldClaw代表了3D生成领域正在发生的一次范式转移:从单物体生成走向世界级场景生成,从一次性渲染走向可编辑、可复用的资产化产出。社区对这项工作的反响热烈,展示官网上放出的成片质感惊艳,开发者们正在等待官方开源权重,以便把这一框架接入自己的创作管线。
WorldClaw的核心设计是全智能体协作的粗到细生成流程。第一层是规划智能体,负责理解文本提示,把它翻译成一份结构化的场景规格说明书,明确包含哪些区域、每种区域的地形特征、需要哪些资产、材质如何搭配、空间关系如何组织。这一环节相当于人类建筑师在动工前画图纸,先定义清楚要建什么,再决定怎么建。
第二层是地形生成,基于语义布局构建全局连贯的地形基底,包括可复用的生成资产、程序化或生成式材质、以及区域感知的高度场。对于细节要求高的区域,系统会生成地形条件约束下的场景组合,重建可编辑的纹理网格,并恢复它们在场景中的放置位置。最后一层由基于渲染的智能体负责细化,持续修正地形、物体、外观与接触关系,确保生成结果既符合空间逻辑,又具备视觉说服力。
这种分工协作的架构带来两个直接好处。一是全局一致性有保障,规划阶段就定义好的空间关系,避免了生成过程中区域之间的冲突与割裂;二是局部可控性强,每个区域的资产都可以独立生成、独立替换,创作者可以在不推翻全局的前提下修改局部内容,这对于实际生产流程至关重要。
WorldClaw与既往3D生成方法最大的差异,在于对可编辑性的执着。论文强调,生成结果不仅是视觉上合理的画面,更是显式的、可复用的实例级资产。每个物体都有独立的网格与材质,可以单独选中、编辑、替换,场景文件可以被下游工具链直接使用,这与纯图像渲染式生成有着本质区别。
可编辑性的价值在真实生产场景中尤为明显。游戏开发中,美术团队需要的是可以放进引擎、可以调参的资产,而不是一张无法修改的静态渲染图;影视制作中,导演需要在生成场景上继续推镜头、改光线;机器人仿真中,工程师需要在虚拟场景中调整障碍物布局以覆盖更多测试用例。WorldClaw把生成结果做成可编辑的工程资产,等于为这些下游环节铺平了道路。
这也是3D世界生成商业化落地的关键门槛。过去一年,多家团队展示过令人惊叹的3D场景生成demo,但大多数止步于演示,因为生成结果无法进入实际生产管线。WorldClaw把资产化、可编辑作为核心目标,意味着它从一开始就是为工程化使用设计的,而非单纯追求视觉震撼。
论文把现有3D场景生成方法归纳为四条技术路线:程序化内容生成,通过规则与程序构建地形植被建筑,控制性强但表达力受限于硬编码规则;图像视频提升,借助图像或视频生成模型合成场景观测再提升为3D表示,内容丰富但缺乏全局一致性与几何保真度;原生3D扩散,直接学习3D体素、距离场或高斯的分布,几何质量高但受限于3D场景数据集的稀缺;多模态大模型智能体,用LLM驱动生成流程,灵活但常缺乏精细的几何控制。
WorldClaw属于第四条路线,但它通过多智能体协作弥补了既往智能体方法在几何细节上的短板。规划智能体保证全局结构,生成智能体负责地形与资产,渲染智能体精修视觉细节,三层协作让LLM的语义理解能力与3D生成的质量要求得以兼顾。在论文展示的跨场景实验中,WorldClaw生成的开放世界在空间组织连贯性、局部内容吸引力与实例资产可编辑性上均表现稳定,保持了全局地形结构的统一。
当然,WorldClaw也坦承自身的局限。大规模场景的生成计算开销依然巨大,资产类型覆盖范围有限,与顶级手工场景的品质差距仍然存在。但作为首个把智能体协作与可编辑资产化作为核心设计目标的开放世界生成框架,它为行业指明了一条从能看走向能用的演进路径。
开放世界生成技术的潜在市场覆盖多个行业。游戏是最直观的应用场景,开放世界游戏的地图构建成本极高,一张高质量地图往往需要美术团队数月甚至数年打磨,WorldClaw这类技术可以把初期概念设计阶段压缩到分钟级,让策划团队快速验证世界设定的可玩性,再让美术团队在生成的基底上精修。
影视与VR领域同样受益。电影场景预演、虚拟制片背景、VR沉浸式体验内容,都需要大量高质量3D场景,生成式工作流可以显著降低场景搭建成本,让中小制作团队也能驾驭宏大的视觉设定。工业数字孪生方面,工厂、园区、城市级的3D场景重建是数字孪生的基础,生成式方法有望加速这一过程的自动化。
更具想象空间的是具身智能与机器人仿真。机器人在真实环境中的训练成本高昂且存在安全风险,世界模型提供的虚拟仿真场可以把训练试错转移到算力集群。WorldClaw生成的物理合理、可交互的3D世界,正是机器人训练所需的仿真环境素材。腾讯混元把WorldClaw与3D世界模型、机器人仿真放在同一技术版图上布局,瞄准的正是这个正在膨胀的产业需求。3D世界生成的下半场,比拼的不再是谁能生成更炫的画面,而是谁能把生成结果真正接进生产与训练管线。