世界模型在过去一年里被反复讨论,却始终缺少一个能让人直观判断进展的交付形态。9月中旬,李飞飞创办的World Labs给出了一个具体答案:用32张英伟达Voyager园区的照片作为输入,Atlas模型生成了一个可以实时漫游的3D场景,用户能在园区里自由选择路径、查看任意区域的细节。英伟达与World Labs双方官方账号同步发布了演示,Atlas在Blackwell GPU上从零预训练,把文字、图像、视频与三维数据统一到共享的空间上下文里。
传统视觉输入处理的是二维像素阵列,一张图就是一张图,没有深度,没有尺度,也没有遮挡关系。Atlas的做法是给每一张输入照片标注三维坐标,让模型知道这张图是从哪个方向拍的、和其他照片之间是什么关系。输入的含义因此从拍到了什么变成从哪拍的、与周围如何关联。这一步改变了世界模型的底层结构,因为视觉模块的输出不再是压缩后的像素特征,而是带坐标的空间信息。
一个典型场景能说明差别。在一个房间里朝东、朝北、朝西各拍一张照片,传统模型看到的是三张独立的平面图,而Atlas能判断这三张图来自同一个房间的不同角度,并把它们还原成一张完整的三维房间地图。这不是画面拼接,而是空间重建。研究者的判断是,Atlas把视觉模块与记忆模块这两个环节同时向前推了一大步:视觉端从像素压缩转向点云输出,记忆端则在三维空间中模拟时空变化。
空间上下文的代价是数据要求变高。模型需要知道每张输入图的拍摄位置与朝向,这意味着输入不再是随手拍的照片集合,而需要带有可推断的相机信息。Atlas的做法是从图像本身反推位姿,把标注负担转移到模型侧。
3D场景构建的核心门槛一直是几何结构的还原精度,传统流程需要专业设备拍摄数百张照片再耗时建模。Atlas的输入范围是2到25张普通照片,输出一个完整的三维场景,可被仿真器直接导入作为视觉环境的基础。官方透露通常只需要两到三张图就能实现可用的重建,也能处理超过一百张输入做精细建模。
官方演示展示了逐步构建的过程:一开始只给一张办公桌的局部特写,模型生成一张室内全景图,画面中办公桌和电脑是准确的,但旁边的椅子和墙面全靠脑补;再加入第二张房间整体视角的照片,桌椅位置修正了,但画面右侧的显示器区域仍然空缺;直到加入第三张侧面双屏工作台的照片,整个办公场景才完整对齐。输入越多,需要脑补的部分就越少。另一个案例是斯坦福大学主方庭,仅凭几张地面拍摄的手机照片,Atlas就生成了从校园高空俯瞰的连续飞行画面。
输入数量与重建质量之间的关系是这条路径的核心变量。官方给出的范围是通常两到三张即可得到可用的重建结果,超过一百张则可以做精细建模。对机器人训练场景来说,这个弹性区间意味着可以用低成本快速搭建大量粗粒度环境,再对关键场景做精细重建。
把Atlas与同期视频生成模型放在一起比较,能看清两条路线的分歧。视频生成追求像素连贯性与视觉真实感,最终交付一个视频文件;Atlas接收多角度照片后直接输出点云、三维高斯泼溅等计算机可解析的几何数据,构建出机器人可以直接操作的数字空间。前者服务于内容创作,后者服务于仿真与训练。
这个差异决定了应用场景。机器人在真实世界里训练成本高昂、风险不可控,如果能在重建出的三维环境里先跑路径规划与空间交互,试错成本会大幅下降。Atlas的相机可控生成能力允许用户设计运动轨迹,模型沿坐标渲染最高1440p分辨率、时长1分钟的视频,这也为合成训练数据提供了另一种输入方式。官方同时披露了一项延伸成果:基于统一了内部世界模型、具身推理与直接控制的具身基础模型,实现了零样本全自主无人机飞行。
两条路线并非互相替代。视频生成可以产出高真实感的画面用于展示与传播,几何重建则提供可计算的坐标用于仿真与规划。真正有价值的组合,是先用几何数据搭出可交互的空间,再用生成能力补足纹理与光照细节。
World Labs并非孤军作战。英伟达推出了绑定算力的Cosmos仿真平台,谷歌持续迭代Genie系列,Meta的V-JEPA 2用超过100万小时视频做自监督训练;国内方面,Manifold AI自研的WorldScape模型登顶多项技术榜单,摩尔线程开源的MT Lambda仿真平台已通过真机验证。技术路线的分歧也在显现:究竟应该聚焦视觉效果生成,还是构建可交互的数字空间,各家给出了不同答案。
但整个赛道的商业化路径依然模糊。有分析指出,世界模型领域的主要玩家在试图赚钱这件事上排名并不靠前,多数公司仍处于研究与构建阶段,不愿公开产品计划与时间表。这种谨慎甚至延伸到供应商层面,一家为世界模型公司提供数据的厂商表示,自己并不清楚客户究竟在构建什么,如果知道的话可以提供更有针对性的数据。世界模型的多用途特性既带来了想象空间,也让产品定位变得难以收敛,同一种建模方法既能让自动驾驶汽车在车流中穿行,也能帮人形机器人搬运箱子,还能把几分钟视频变成可探索的环境。Atlas的价值在于它把讨论从概念推进到了可测量的交付物,接下来要看的是这些三维空间能否真正嵌入生产与训练流程。