想要用AI重建一个房间的三维模型,传统方法往往需要从几十上百个角度拍摄照片,如果只给六到八张稀疏视角的图片,结果常常是墙面缺失、物体模糊、伪影丛生。浙江大学CAD&CG国家重点实验室团队在SIGGRAPH 2026发表的S2C-3D框架,正是冲着这个痛点而来,它仅凭6到8张稀疏视角照片,就能重建出完整、无缺失区域、无明显伪影的高质量3D场景,相关论文已公开发布。
这项研究的价值在于把稀疏视角重建的可用性推到了新高度。论文显示,S2C-3D在仅使用8张图片的条件下,重建质量明显优于目前最先进的Difix3D+等方法,房间角落、家具轮廓、堆叠物体等细节都能被完整恢复,不再出现大面积的空洞和模糊。对于空间智能、数字孪生、机器人仿真等依赖3D场景数据的应用来说,这意味着数据采集成本有望大幅下降。
3D重建领域长期存在一个两难困境:稠密视角输入能保证质量,但采集成本高昂,需要专业设备绕着物体走上一大圈,还要处理海量图像数据;稀疏视角输入虽然采集方便,但视角覆盖不足会导致重建结果出现严重的缺失区域、模糊和伪影。此前的3DGS方法在稀疏输入下,经常出现墙面整块消失、物体轮廓粘连、渲染画面闪烁等问题,难以直接用于生产环境。
更深层的难点在于,稀疏视角下每个视图都承载着不可替代的信息,任何一张图的重建失误都会被放大,模型没有冗余视角可以纠错。同时,相机轨迹的规划也直接影响覆盖效果,如果拍摄角度分布不合理,即使增加照片数量,重建质量也难以提升。S2C-3D的研究团队正是从这些环节入手,用一套组合方案系统性解决稀疏重建的顽疾,而不是在单一模块上修修补补。
行业对稀疏视角重建的需求,其实比想象中更迫切。游戏行业需要把真实场景快速转成可编辑的3D资产,电商需要从几张商品图生成可交互的3D展示,测绘和工业领域则希望用无人机拍摄的有限视角还原完整场地,这些场景的共同特点是拍摄条件受限、视角数量有限,但重建结果却要直接投入生产。S2C-3D把6到8张照片的输入条件作为设计目标,正是瞄准了这些真实需求。
S2C-3D由三个核心组件构成。第一个组件是场景专属扩散模型,团队在一个预训练架构上,用输入视图及其对应的退化版本进行微调,让模型学会修复高斯渲染中的破损区域,同时消除域差距。这种方法相当于让AI针对当前场景补全缺失的几何信息,而不是依赖通用先验盲目想象,既保证了补全的合理性,也避免了跨场景迁移带来的失真。
第二个组件是免训练的视图一致性条件采样过程,在扩散模型的采样阶段融入多视图一致性约束,优化后的高斯参数能够保持视角间的连贯,不会出现从某个角度看是完整的、换个角度就塌陷的问题。在实验设置上,团队采用标准化的评估协议,使用8张图片作为稀疏输入,在多个室内场景上对比了原始3DGS、Difix3D+和S2C-3D的重建结果,从客观指标到主观视觉质量进行了全面比较,结果显示S2C-3D在缺失区域占比、渲染清晰度和几何完整性上全面领先,尤其是在墙面、地板等大面积平滑区域的修复上,效果提升最为明显。第三个组件是相机轨迹规划方案,通过优化拍摄路径确保场景覆盖的全面性,避免出现拍摄盲区。三者协同,让S2C-3D在6到8张照片的极端稀疏条件下依然能交出高质量结果。
值得一提的是,S2C-3D的第二个组件不需要额外训练,这意味着它可以即插即用地适配不同的底层生成模型,而不需要为每个模型重新训练一套专用网络。团队在论文中展示了多个场景的定性对比,从室内房间到室外堆叠物,S2C-3D在缺失区域修复、边缘清晰度和跨视角一致性上的表现都明显优于基线方法,视觉质量与8张图输入条件下的人类预期相当接近。
S2C-3D的突破,恰好踩在了3D重建与3D生成加速融合的节点上。传统的3D重建强调忠实恢复已观测到的部分,3D生成则依赖大规模数据先验补全未见结构,两者各有短板。近期学术界出现的Stream3D等流式框架,正在尝试把持续到来的视频流变成重建与生成共同作用的输入,S2C-3D则从稀疏视角这一维度切入,把生成先验用作重建的补全工具,本质上是同一趋势的不同切面。
这种融合趋势对产业的意义十分直接。具身智能需要海量可训练的三维场景数据,自动驾驶需要快速重建测试环境,数字孪生需要低成本还原物理空间,这些场景的共同诉求都是更少的采集、更好的质量。当稀疏视角重建逼近稠密重建的精度,3D数据生产的成本结构将被改写,这也是S2C-3D这类研究最值得关注的地方。当然,该框架目前对动态物体和极端光照场景仍有局限,从论文走向工程化应用还需要更多探索,但它指向的方向已经足够清晰。
学术界对这一方向的关注也在升温。SIGGRAPH 2026上,与稀疏视角重建相关的论文数量明显增加,浙大、港科大、南洋理工等团队从不同角度切入同一命题,有的侧重流式输入,有的侧重稀疏视角,有的侧重物理约束。当足够多的团队在同一个方向上取得进展,往往意味着这个方向正在从研究热点走向工程现实,稀疏视角3D重建的商业化窗口正在打开。