如何从一段视频中获得完整、稳定的3D物体,这个问题长期把研究者分成两个阵营。一派坚持3D重建路线,把不同视角中真实观察到的几何逐步拼接起来,擅长忠实恢复已经看见的部分,却在遮挡严重、物体背面从未出现时留下缺口。另一派走3D生成路线,借助大规模数据中学到的先验,从单张图像推断并补全完整物体,却可能对同一物体的不同视角作出互相矛盾的想象。
两条路线各有所长,但当输入不再是单张图片,而是一段持续到来、没有预设终点的单目视频流时,真正的解法或许不是二选一,而是让生成模型像重建系统一样不断吸收新证据,再利用生成先验补全尚未被观察到的部分。近日,来自香港科技大学World Mind Lab、麻省理工学院Media Lab与EECS、哈佛大学Kempner Institute的研究团队提出Stream3D,试图打通这两条路线,相关成果在AI 3D社区引发广泛讨论。
要理解Stream3D的价值,需要先看清动态场景中两条技术路线的固有缺陷。3D重建系统以观测数据为唯一依据,从视频不同帧中提取特征点并逐步拼接几何结构。当摄像头围绕物体缓慢转动时,系统可以恢复大部分表面,但一旦物体背面从未出现在视野中,或者前景遮挡了后景,重建结果就会留下真实存在的空洞。这种方法的本质决定了它只能恢复看得见的部分,对看不见的区域无能为力。
3D生成模型则走向另一个极端。它们从海量数据中学习物体的一般形态规律,面对一张正面照片,可以凭先验知识补出背面的大致形状。但这种补全带有强烈的主观想象成分,不同视角生成的结果往往互相矛盾,正面像一只猫、背面却长出四条腿的情况时有发生。更麻烦的是,单图生成无法利用视频中连续出现的多视角信息,每一次生成都是独立采样,浪费了视频流本身蕴含的丰富证据。
这两条路线的分歧本质上是对忠实度与想象力的取舍,而真实世界的3D感知恰恰需要两者兼备。机器人抓取物体前需要知道背面是否存在抓手结构,自动驾驶需要根据连续视频流重建完整场景,数字孪生需要从多角度影像还原真实资产。当应用场景越来越复杂,单纯的重建或单纯的生成都无法满足需求,这正是Stream3D选择让两者融合的根本动因。
Stream3D的技术设计堪称巧妙:它为冻结的视图条件3D生成器加入一套训练免费的流式机制,模型一边从视频流中持续筛选并积累可靠的多视角证据,一边生成跨时间、跨视角一致的完整3D结果。所谓训练免费,意味着研究团队没有重新训练任何底层模型,也没有修改生成器的网络结构,而是通过一套轻量的外部机制,让现有模型获得持续观测能力。
这套机制的实现依赖于一个关键设计:固定容量的证据记忆。Stream3D只保存固定容量的证据块,使跨分块状态不随视频长度线性增长。无论视频流持续多长时间,系统的记忆开销都保持恒定,这让流式处理大规模视频成为可能。更重要的是,由于不修改底层生成器的结构,SAM 3D、TRELLIS、Hunyuan 3D等原本面向单图或固定多视角输入的生成模型,都可以直接获得类似在线重建的持续观测能力,无需任何额外训练。
在实验结果中,Stream3D展现出明显的性能优势。研究团队利用连续到来的多视角信息进行生成,结果比逐帧使用SAM 3D更接近真实3D物体。具体而言,模型在物体正面获得清晰的几何证据后,会主动用生成先验补全背面与隐藏区域,并保证补全部分与已观测部分在几何和纹理上保持连贯。这种边看边补全的工作方式,既保留了重建系统对观测的忠实,又发挥了生成系统对未知区域的想象能力。
Stream3D的应用潜力远超学术范畴。在具身智能领域,机器人需要从实时视频流中快速构建周围环境的3D理解,过去受限于重建的缺口和生成的幻觉,机器人的空间认知经常出错。有了流式生成能力,机器人可以在移动过程中持续积累环境证据,同时利用先验知识补全遮挡区域,对未知空间的预判能力将显著提升。
在消费场景中,用户随手拍摄的一段环绕视频,未来可以直接生成可编辑、可打印的完整3D模型,无需专业设备与建模技巧。在工业数字孪生场景中,巡检无人机拍摄的视频流可以实时转化为设备的三维数字资产,磨损、变形等异常状态也能被更准确地捕捉。研究团队表示,后续将探索把Stream3D扩展到更长的视频时序与更多样的动态场景,并推动其在机器人、影视制作与数字孪生等领域的工程化落地。
从更宏观的视角看,Stream3D代表了一种技术融合的范式转变。过去3D重建与3D生成被视为竞争关系,前者强调真实,后者追求想象,而这项研究证明两者可以协同工作:生成模型像重建系统一样持续吸收证据,重建系统利用生成先验补全缺失。当AI既能看到又能想象,通往完整、稳定、可用的3D世界模型的道路,正在被一条条打通。
在技术实现层面,Stream3D的证据筛选机制也颇具巧思。视频流中并非每一帧都包含新的几何信息,模型会评估每个新视角对整体重建的边际贡献,只保留最可靠、信息量最大的证据,丢弃冗余帧。这种筛选机制让模型在有限记忆容量下最大化信息利用率,也保证了长时间视频处理过程中的稳定性。研究团队将这一机制比作人类的注意力系统,眼睛时刻在动,但大脑只记住重要的画面,这正是Stream3D能够兼顾效率与质量的关键设计。