李飞飞团队发布Atlas世界模型,一张照片生成一分钟视频,3D重建碾压专用模型

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

北京时间9月2日,"AI教母"李飞飞旗下创企World Labs正式发布新一代世界模型Atlas,被其团队称为"全球首个多模态世界模型"。与以往只生成2D画面的视频模型不同,Atlas从头开始预训练,原生同时处理文字、图像、视频与3D数据,所有输入被统一编码进一个共享的空间上下文。李飞飞在社交平台表示,这是迄今最优秀的相机控制世界模型,为从视觉特效到机器人训练等众多应用打开了大门。从一张普通照片生成可随意漫游的3D场景,Atlas试图证明AI已经能够理解并重建三维世界的几何与物理逻辑。

空间上下文取代文本上下文,模型拿起了坐标尺

Atlas最底层的创新,是用"空间上下文"取代了大模型惯用的"文本上下文"。传统大模型把图片当作平面像素处理,而Atlas在编码阶段就把每一张输入图像锚定在三维空间中的精确位置,并附带对应的相机位姿与深度信息。相当于模型拿到了一本带坐标轴和比例尺的三维草稿本,在理解世界时有了明确的几何参考。这种设计让Atlas能够天然地"想象"画面之外的空间,从一张正面照片推断出物体的背面与周围环境,并在不同视角之间保持几何一致性。

架构层面,Atlas采用多模态自回归扩散Transformer,将文字、图像、视频与3D四种模态统一映射到共享的空间上下文,再据此预测"接下来会发生什么"。World Labs强调Atlas的性能会随训练算力增长而持续提升,其能力图谱覆盖四大任务:相机控制生成、空间重建、时空模拟与图像生成。基于一张到六张参考图像,Atlas可以按用户指定的任意相机轨迹生成最长一分钟的1440P视频,画面内容与输入图像的几何结构严格对齐,还能平滑外推出输入中不可见的部分,例如为照片中的机器人补全背部,或为泳池旁的草坪填上合理细节。

相机控制能力的价值,最先会被影视与广告行业感知。传统视觉特效流程中,一个镜头从分镜到成片往往需要场景重建、绑定、动画与渲染多个环节,制作周期以周计算;Atlas这类世界模型把镜头运动直接变成模型的生成条件,创作者输入一张概念图,就能立刻得到沿指定轨迹运动的动态预演,用来快速验证机位设计与叙事节奏。虽然当前输出距离电影级渲染仍有差距,但作为前期可视化工具,它已经能把原本需要专业三维团队完成的镜头验证压缩到数分钟级别,对短视频工作室与独立游戏团队尤其有吸引力。随着生成分辨率与物理真实度继续爬坡,这类工具完全可能反向渗透进正式制作管线,改变视效行业的协作方式。

稀疏重建超越专用模型,一张照片重建斯坦福主方庭

空间重建是Atlas最令人惊艳的能力之一。传统3D重建通常需要成百上千张密集照片配合专业采集设备,而Atlas在稀疏视角下表现出色,官方公布其在DTU等公开数据集上的重建误差指标优于多个专用3D重建模型。World Labs展示的一个案例中,研究团队仅凭2到25张手机拍摄的地面照片,就重建了斯坦福大学整个主方庭,并能生成高空俯瞰的飞行路径视角。对影视与游戏行业而言,这意味着用几张随手拍的照片就能还原一个真实空间,传统需要昂贵设备与漫长周期的场景采集流程将被大幅简化。

Atlas还支持"子弹时间"式的时空模拟,输入普通手机拍摄的视频片段,模型可以重构出多视角拍摄系统才能实现的效果,让时间冻结并切换任意视角。文本生图方面,Atlas能根据复杂提示词生成图像与360度全景图,精准呈现文字并驾驭多种视觉风格。这些能力共同指向World Labs更大的野心,具身智能。开发者在真实空间用手机拍摄一段素材,Atlas即可重建出机器人可导航、可交互的3D仿真环境,并生成对应的RGB图像与深度传感数据,相当于把昂贵的真实数据采集压缩成一次普通拍摄,为机器人训练的Real-to-Sim流程提供了全新路径。

具身智能方向的落地同样需要理性看待。World Labs展示的手机拍摄直出仿真环境,解决了机器人训练数据采集贵、场景单一的部分痛点,但真实世界的物理交互、材质属性与动态物体,仍需要更精细的建模才能支撑;从看得懂的3D场景到可操作的仿真环境,中间还隔着物理引擎与策略训练的层层打磨。即便如此,Atlas在稀疏输入下的重建表现,已经让不少机器人团队看到希望,用一部手机替代激光雷达与专业采集车,意味着中小团队也能积累属于自己的场景数据,把过去只有大厂才玩得起的仿真训练门槛明显拉低。世界模型与具身智能之间的桥梁,正在被一块块地搭起来。

开源对手环伺,世界模型赛道进入密集竞赛期

Atlas发布的时间点,恰逢世界模型赛道竞争白热化。谷歌DeepMind的Genie 3已能实时生成可交互环境,英伟达Cosmos平台下载量超过200万次,成为机器人训练的主流管线之一,Odyssey与Yann LeCun的AMI Labs也各自押注不同技术路线。值得注意的是,英伟达既是World Labs的竞争对手,也是其投资人,曾在2月参与的10亿美元融资轮中出资,该轮还吸引了AMD、Autodesk、富达投资等机构,估值达50亿美元。竞争对手与股东双重身份并存,反映出世界模型赛道既相互竞争又深度绑定的复杂生态。

World Labs声称Atlas在盲测中相较Gemini Omni Flash、FLUX等对手获得压倒性偏好,在稀疏输入3D重建上超越多个顶级开源模型。不过这些测试全部来自官方自家评估,尚未有独立第三方复现,且Atlas发布时未附研究论文、定价与开放时间表,API文档中甚至还没有Atlas端点,被部分媒体质疑"只展示成绩单、不展示收据"。可以确定的是,李飞飞押注的空间智能理论正在从论文走向可用的产品底座,而它与谷歌、英伟达围绕世界模型定义权的竞赛,才刚刚进入最激烈的阶段。

素材来源:科创板日报、中国证券报、SiliconAngle 发布时间:2026-09-04