腾讯ARC Lab与北京大学联合开源了一款视频世界模型WorldCrafter,核心主张相当反直觉:做可漫游的生成式世界,不必先老老实实建一个3D模型。团队跳过了显式三维重建,改用一套可按相机位姿查询的隐式3D感知记忆,让用户在自己生成的虚拟世界里自由漫游数分钟,回头看时场景依然对得上。论文、代码与推理权重全部开源,基础版与经过蒸馏加速的Fast版都已放出。
所谓视频世界模型,指一套能根据动作输入持续推演并绘制后续画面的交互系统:按下前进画面就向前推,按下左转视角就向左摇,像在玩一款由神经网络实时绘制的3D游戏。长期困扰这一方向的是长程回访一致性:镜头移开再转回来,之前看到的东西是否还在原处。论文把已有方案归成三条路,各有代价。
第一条是上下文记忆,把历史帧或特征留给注意力机制。全历史做注意力算力吃不消,按相机相似度只检索几帧,又会用覆盖范围换效率,容易丢三落四。第二条是空间记忆,先估算深度、把旧画面扭曲对齐到新视角,代表路线包括英伟达等团队的GEN3C与Lyra 2.0等方案。它依赖几何精度,且强行对齐目标视角会把动态物体锁死,深度一错整个画面就像碎裂的石膏一样坍塌。第三条是隐式记忆,方向对,但已有工作多用几何估计器的特征做初始化或监督,而几何预训练的任务目标是预测几何,不是复现外观,重访时墙面花纹与材质细节恰恰是它不关心的。
WorldCrafter的切入点,是拿新视角合成任务的预训练模型当记忆的海马体。新视角合成要求从别的视角把场景画对,几何与外观一个都不能丢,这正是重访时还原原样所需要的归纳偏置。整套记忆机制分成三步。第一步是最大覆盖检索,模型在长漫游中挑出具有代表性、视角互补的历史关键片段,保留最新一帧再贪心选八帧,标准是联合视野对即将到来的轨迹覆盖最大,而不是按两两相似度排序。
第二步是记忆编码,编码器把历史潜空间帧与相机参数浓缩成紧凑的隐式空间表示,不落地任何显式3D重建。第三步是位姿引导读出,当虚拟相机指向某个新角度时,模型从即将生成的轨迹里采样一组查询位姿,像查数据库一样把表示读成固定数量的记忆标记,即时喂给视频生成大模型。作者把这一设计概括为:以前见过的空间交给记忆,眼前正在发生的运动交给生成器。整个过程中没有深度估计,也没有几何扭曲。
这套设计的代价也值得说清楚。记忆编码需要在每个视频块生成后重新处理一遍历史潜空间帧,随着漫游时间变长,这部分开销会线性累积,而不是保持恒定。作者把增量式流式记忆列为后续工作,说明当前的实现更适合数分钟级别的漫游,而非无限时长。更实际的问题是,数分钟的漫游已经能覆盖大部分演示与预览需求,但要支撑完整剧情片级别的长度,记忆的压缩与复用效率还需要再上一个台阶。
团队自建了一套严苛基准,包含145个场景与725条度量轨迹,轨迹长度在528到1648帧之间,并刻意包含大量绕一圈再回来的闭环测试。在感知差异指标LPIPS上,最强基线Lyra 2.0为0.487,WorldCrafter压到0.255,相对提升47.6%,蒸馏版进一步降到0.186;峰值信噪比从14.05提升到18.02。相机控制的三项误差也全部为全场最低,VBench综合画质得分81.91位居对比方法之首。
效率上的差距同样明显。传统深度估计加几何变形的管线,每处理一个视频块的记忆就要耗费约1.346秒;WorldCrafter的隐式编码与相机读出合计仅0.062秒,相差约21.7倍。消融实验还给出了一个关键对照:如果把隐式记忆换回检索四帧历史的方式,LPIPS会从0.255崩到0.497,说明增益主体来自隐式3D记忆本身;而且重访间隔越长,它相对上下文记忆的领先越大,意味着它记住的不是最近的样子,而是场景本身。
工程交付方面,团队在Hugging Face放出了基础版与Fast版两组权重,Fast版经过少步扩散蒸馏,专为流式交互设计。交互控制很接地气:W与S前进后退,A与D左右平移,Q与E升高降低视线,方向键掌控俯仰与偏航转向,用户可以输入类似前进两次、左转三十度三次、后退一步这样的动作指令。在多卡实验室环境下,Fast版已能跑出约16fps的交互流式速度。
边界也很清楚。当前开源版本的分辨率锁定在384乘640,官方表示先把底层架构与一致性逻辑打通,分辨率放大在工程上只是时间问题;在更长更刁钻的漫游路径上仍存在漂移可能;每生成一个视频块都要重新编码一遍历史记忆,带来额外延迟,团队把增量式流式记忆列为后续工作。许可方面,开源协议目前明确限定为学术研究用途,不得直接用于商业生产。放在更大的坐标里看,这次开源折射出世界模型领域的三股分化力量:工业级3D资产派追求毫米级可编辑图纸,闭源巨头的大玩具派主打惊艳演示,而隐式记忆派试图用可复现的权重为社区提供一套可拆解的基石。