港科大腾讯开源VibeWorlding,一句话生成可交互3D世界,AI造物提速

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

程序员圈早有"vibe coding",凭氛围写代码,如今"vibe worlding",凭氛围造世界,正在成为现实。8月19日,香港科技大学(广州)与腾讯联合开源了VibeWorlding框架,这是业界首个端到端3D世界构建的智能体强化学习框架。你只需说一句"用谷仓、农田、围栏和几棵树创建一个简单的农场",Agent就会自己检索3D资产、规划布局、调用工具摆放、渲染图片检查,最终交出一个可以交互的3D世界;你也可以对已有世界说"把路中间的车移走,删掉两栋绿色建筑",Agent会精准执行修改。从手工建模到一句话生成,3D内容生产的方式正在被重新定义。

考场加健身房,VibeWorlding的底座如何搭建

VibeWorlding由两大部分构成,一半是"考场"VWE-Bench评测基准,一半是"健身房"VibeWorlding-Gym训练框架,两者共用同一个基于Blender的开源软件沙盒。为了支撑这套体系,研究团队投入了大量数据工程:构建了2616个高质量3D资产,横跨20个语义类别,从桌椅道具到大型建筑一应俱全,每个资产都标注了真实世界尺度下的物理包围盒;再由专业美术师用这些资产搭建了323个"种子世界",复杂度从8个资产到258个资产不等;最后通过多模态大模型逆向合成6828条用户查询,涵盖从零构建与精修两大类,其中还故意混入"要求一个资产库里不存在的物体"之类的干扰项,考验Agent的鲁棒性。

训练框架的设计同样考究。Agent在沙盒环境中只有五个工具:检索资产、添加资产、删除资产、旋转资产、平移资产,每次操作后Blender从前后左右俯视五个固定视角渲染图像作为反馈,模型"看图改图",多轮迭代直到完成任务。双约束验证器同时检查物理可行性与意图满足度:碰撞检测看资产包围盒是否交叠过深,高度检查看物体是否悬空或陷地;意图满足则由多模态大模型判官按生态合理性、3D理解、3D推理、检索合理性四个维度打分,必须达到4分才通过。为了堵住投机行为,防作弊机制规定可验证查询只允许授权范围内的修改,多删一个资产整轮判零分。这些资产、世界与查询数据的构建流程全部公开,任何团队都能基于同一套基准复现实验、验证自己的模型,这也是VWE-Bench区别于零散评测的核心价值。

开源模型反超闭源旗舰,59.3%的Pass@1含金量

在VWE-Bench的成绩单上,最前沿的闭源模型也远未解决这项任务:GPT-5.5总体Pass@1为57.3%,Qwen3.8-Max为56.9%,都不足60%。而研究团队从Qwen3-VL-30B-A3B基座出发,经过全参数监督微调与多模态GRPO强化学习训练出的开源模型VibeWorlder-30B-A3B,以59.3%的Pass@1排在所有参评模型第一,在可验证集上更是以64.5%对60.4%明显领先GPT-5.5。8B版本的VibeWorlder-8B总体41.4%,与Gemini 3.1-pro的42.7%基本打平,可验证集上反而以59.3%对44.4%大幅领先。

提升路径同样说明问题:同一基座原始只有13.6%的通过率,监督微调后提升到34.5%,强化学习后跃升至59.3%,强化学习这一步带来的涨幅最大。研究还发现,给前沿模型套现成的规划框架(如以GPT-5.5为核心的Agent脚手架)只能拿到13.6%到16.3%的成绩,远不如直接训练,这印证了"会思考的模型不等于会干活的Agent"。人工盲评交叉验证显示,自动验证器与专业3D美术师的判定一致率达83.4%,奖励与人工评分相关性高达0.88,说明这套训练体系的质量信号是可靠的。

看图改图的强化学习,AI如何学会空间推理

VibeWorlding最核心的技术贡献,在于把强化学习成功应用到了3D空间推理任务上。模型每轮"思考加行动"的循环中,既依赖文本坐标理解世界,也依赖自己"看到"的五张渲染图进行判断,这种多模态反馈让模型学会了把空间意图转化为正确的工具调用。数据显示,3D推理能力(把空间意图变成正确工具调用)从基座的6%到20%,强化学习后提升到56%到85%,VibeWorlder-30B-A3B达到85%,超过Gemini 3.1-pro的62%;3D理解从0.17涨到0.80,响应幻觉率从62.5%压到9.2%,模型真正做到"说做一致"。

当然,论文也坦承了边界:碰撞避免是所有模型的共同短板,通过率只有59%到68%,"不碰撞地精确摆放"是当前最核心的未解难题;"距离对了方向反了"的坐标系理解错误和"过度编辑"是两大主导失败模式;资产库目前只有卡通美术风格,最大种子世界258个资产,距离真正"开放世界"的规模还有距离。未来方向包括更高层的组合工具、多Agent协作建大世界,以及把碰撞反馈直接做成奖励信号。这套框架的代码、数据、模型权重全部开源,游戏开发、数字孪生、具身智能仿真等领域都可以直接使用,AI造物的下一站,正在从"造物体"走向"造世界"。

素材来源:腾讯新闻、机器之心、arXiv、新浪科技 发布时间:2026-08-25