9月8日,华为苏黎世研究中心Bayer Lab联合洛桑联邦理工学院与博洛尼亚大学在arXiv公开Marigold V2,把开源图像编辑模型Qwen-Image-Edit-2509改造成单步密集预测器,输入一张普通RGB照片,可以同时输出深度图、穿透深度、表面法线与反照率四种结果。论文已被SIGGRAPH Asia 2026接收,将刊发于ACM Transactions on Graphics。
它的训练配置刻意压到极小:7.4万张训练图、一张32GB消费级显卡、一周以内训完,却在五个零样本基准上同时刷新最优结果。论文标题里的关键词是重访,意思是上一代做过的事,这一代用更大的底座重新做了一遍,而且精度出现跨代提升。
单目深度估计本质是一个病态问题,一张二维图对应无穷多三维场景。判别式模型靠百万级标注数据硬学,精度很高,但训练数据里没有的长尾场景,比如非朗伯面与恶劣天气,容易露馅。另一条路线是改造生成模型,因为生成模型在十亿级数据上学到了几何一致的世界表征,只需少量深度标注就能定向激发出来。
Marigold第一代在2024年证明了这条路可行,7.4万张训练图就打平了大半个赛道。问题出在底座换代,生成社区迁移到扩散Transformer之后,改造动辄需要集群:同类方法里,有的即便只用低秩适配仍需96个GPU天,有的要八张卡,从头训练更是数十张卡起步。Marigold V2要回答的问题就是,扩散Transformer时代的低成本改造配方到底长什么样。论文列出的对照很直白:同类方法中,有的即便只用低秩适配仍需近百个GPU天,有的需要八张卡并行,而从头训练的代价更是数十张卡起步。对个人研究者与小型实验室来说,这样的门槛实际上把这条技术路线关在了门外,也正是Marigold V2想要重新打开的口子。
团队的做法是选一个图像编辑模型而不是文生图模型作为底座。Qwen-Image-Edit-2509天然理解输入图到输出图的映射,改成RGB进深度出在接口上最顺。模型把底座量化到4比特精度,再挂上秩为128的QLoRA适配器,只更新一小部分低秩参数,被冻结的底座权重另外下载,训练与部署的显存占用因此大幅下降。
深度目标先做仿射不变的log归一化,按百分之二与百分之九十八分位数稳健裁剪后映射到固定区间,再复制成三通道灰度图喂给变分自编码器,这样能完全复用编辑模型的输入输出接口。训练分两阶段进行:第一阶段只训适配器,跑16万步约五天多;第二阶段加入新损失并解冻解码器,再训3万步约一天。整个流程不到一周,推理时只需一次编码加一次前向,不需要迭代去噪。单步推理是这套方案能落到生产流程的前提。传统扩散系深度估计需要多步去噪,每一步都要跑一次网络,延迟随步数线性增长,很难满足实时或近实时的需求;把时间步固定之后,速度回归退化成一次直接预测,精度损失由训练配方的设计来弥补。
第一个组件是深度版表征对齐。扩散Transformer做深度估计的通病,是在树叶、重复纹理这类语义密集区域丢失细节,已有的对齐方法都拿RGB输入图提取的特征做目标,Marigold V2反其道而行,用冻结的视觉编码器处理真实深度图,把模型中间层的表征对齐到深度本身的语义特征上。直白地说,RGB特征告诉模型这里有一丛树,深度特征直接告诉模型这丛树的空间结构长什么样。
第二个组件针对的是标签本身就是噪声这件事。合成数据集的渲染管线采用准蒙特卡洛采样,半透明的薄结构在某个像素上到底记前景深度还是背景深度,本质上是随机的,逐像素监督等于逼模型去复现噪声。团队把图像切成互不重叠的小块,在块内对预测深度与真实深度做最优传输匹配,只要求块内深度值集合一致、允许置换,于是前景内部连贯、到背景的过渡锐利,边缘的飞点被大幅压低。这两个组件的分工很清楚:对齐解决的是语义细节丢失,损失函数解决的是监督信号本身不可靠。论文的消融实验显示,同一套损失换到其他底座上依然能稳定改善边缘质量,说明起作用的是配方而不是某个特定底座的特性。
成绩单相当硬。在NYUv2、KITTI、ETH3D、ScanNet、DIODE五个零样本基准上,Marigold V2在训练数据五百万以内的方法中全部位列第一,相对第一代的改进幅度从百分之三十五到百分之五十七不等。用超过五百万图像训练的判别式模型作参照时互有胜负,但训练数据量差了三个数量级,性价比的差距比绝对精度更值得关注。
边缘质量是另一条独立赛道。在软边缘误差指标上,Marigold V2的三个口径全部优于专攻细节的同类方法。显存与分辨率的组合更加实用:1024分辨率推理耗时1.9秒、占用16.9GB显存,2048分辨率只要9.6秒、29.3GB,而同场竞技的多个方法在2048分辨率上全部显存溢出。同一套配方换到底座后仍能稳定涨点,说明涨的是训练配方而不是底座红利,代码与权重以Apache 2.0协议开放。论文对边界也很克制:大底座决定了它离实时还有距离,1024分辨率约两秒;运动模糊、散焦与强反射区域仍属本质歧义,作者建议未来做不确定性感知或多层输出。同时训练集对玻璃表面的标注落在玻璃面上而非玻璃之后,透视深度需要专门微调纠正。