在7月17日开幕的2026世界人工智能大会上,腾讯混元展出了其最新研发的3D世界模型2.0版本,正式宣告AI 3D生成从"单物体建模"迈入"全场景生成"的新阶段。这意味着用户不再需要逐个建模再手动拼接,而是可以像拍照一样随意拍一张照片,AI就能在数分钟内生成一个完整的、可从任意角度漫游的三维虚拟世界。
此前,AI 3D生成工具主要解决的是"从文字或图片生成单个3D模型"的问题,无论是Tripo、Meshy还是V2Fun,核心能力都集中在单个物体的几何和纹理生成上。用户想要搭建一个完整场景,需要逐个生成物体再手动放置和调整,就像用积木搭房子,虽然每块积木的质量很高,但拼接过程仍然耗时费力。
腾讯混元3D世界模型2.0的突破在于,它将"场景理解"和"场景生成"合二为一。模型在训练阶段学习了海量的三维场景数据,包括室内装修、城市街景、自然地形等多种类型,掌握了物体之间的空间关系、比例尺度和功能逻辑。用户上传一张参考图片或输入一段文字描述,模型就能自动完成场景布局规划和物体生成的两步工作。腾讯官方在WAIC现场使用一段测试视频展示了这一能力:输入一张"北欧风格客厅"的参考图,系统在3分47秒内生成了一个包含沙发、茶几、落地灯、地毯和装饰画等数十件物件的完整客厅3D场景,所有物件的材质、光影和空间比例都保持了高度的一致性。
与市面上其他"一键生成"工具不同,腾讯混元3D世界模型2.0重点强化了交互式生成能力。用户生成基础场景后,可以通过自然语言对特定区域进行修改和调整,就像和设计师交流一样简单。举个例子,用户生成一个客厅场景后,说"把沙发换成墨绿色的",系统会自动删除原有沙发并生成一个墨绿色皮沙发替换进去;说"在茶几上放一束花",系统就会在茶几上生成一个花瓶和花束,并且自动调整花瓶的大小和位置以匹配场景布局。
这种"可编辑的3D世界"能力背后,是腾讯混元团队在场景级3D表示学习上的重要突破。传统的3D场景生成采用隐式表示,生成的结果是一个"黑盒",用户无法对其中的单个物体进行编辑。而混元3D世界模型2.0采用了"解耦式场景表示"技术,将场景中的每个物体独立编码,让用户在生成后可以像在游戏编辑器中一样自由替换、移动和调整场景中的任意元素。在WAIC现场演示中,技术团队甚至展示了从生成场景中直接导出单个模型资产的能力,生成的GLB文件可以直接导入Blender和Unity等专业工具使用。
对游戏开发行业而言,腾讯混元3D世界模型2.0意味着场景预制作的效率将提升一个数量级。传统游戏场景的制作,从原画设计、模型制作、贴图绘制到场景搭建和光照调试,一个大场景的制作周期通常在数周到数月。而有了3D世界模型的辅助,场景设计师可以在概念设计阶段就用AI快速生成多个风格版本的场景雏形,一旦方案确定再进行精修。腾讯在WAIC现场展示了一个合作案例:某独立游戏团队使用混元3D世界模型2.0生成了游戏主城区的初始版本,经过人工调整后直接进入了游戏引擎,整个流程从原计划的3个月压缩到了2周。
在数字孪生领域,该模型同样展现出巨大的应用价值。数字孪生城市建设中最大的瓶颈就是3D场景数据的获取和更新周期。传统方法需要大量的人工测量和建模工作,导致数字孪生建设成本高、更新慢。腾讯混元3D世界模型2.0可以从无人机航拍影像或卫星图片中自动生成城市级3D场景,并保持每栋建筑的几何精度在亚米级水平。腾讯云智慧城市事业部已经在深圳的某个示范区完成了技术验证,使用该模型生成的数字孪生场景在城市规划模拟和应急演练中表现出了足够的精度和可靠性。
腾讯混元3D世界模型2.0的发布,标志着国产AI 3D技术在场景级生成能力上迈入国际前沿水平。但腾讯混元团队的目标不止于"生成场景",他们的战略愿景是构建真正意义上的"世界模型"。所谓世界模型,是指能够理解三维世界的物理规律、空间关系和时间变化的基础AI系统。腾讯混元3D世界模型2.0在这一方向上迈出了关键一步,它不仅生成了场景的外观,还在一定程度上理解了场景中各物体的功能含义。
在WAIC现场,腾讯还展示了混元3D世界模型2.0与Unity引擎的深度整合方案,开发者可以在Unity中直接调用该模型的生成能力,无需离开熟悉的开发环境。这一生态合作策略有望加速3D世界模型在游戏和XR行业的落地进程。腾讯官方表示,混元3D世界模型2.0的商业版本将在2026年Q3正式对外开放API调用,届时游戏开发者、建筑设计师和数字孪生工程师都可以通过API直接使用这一能力。
在WAIC现场,腾讯还展示了该模型与Unity引擎的深度整合方案,开发者可以在Unity中直接调用该模型的生成能力,无需离开熟悉的开发环境。腾讯混元官方表示,3D世界模型2.0的商业版本将在2026年Q3正式对外开放API调用。