清华联合DeepSeek发布新论文,把AI生图从四步压到一步完成

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

9月28日,一篇题为《统一一步视觉生成分布训练》的论文出现在预印本平台上,作者来自清华大学、复旦大学、西安交通大学、北京大学、浙江大学、DeepSeek、字节跳动Seed、加州大学伯克利分校与北京智源人工智能研究院等机构。论文提出的MGFlow,即混合梯度流,试图给出一套统一的理论框架,把此前各自为战的分布训练方法收拢到同一张图纸上,并据此训练出只需一次前向计算就能出图的一步生成模型。对已经训练完成的生成模型做后训练微调,就能把多步模型改造成高性能的一步生成器。

一步生成难在哪里

敲一句提示词,模型要跑几十步迭代,一点点把噪声擦掉,图像才慢慢浮现。效果很好,但代价摆在明面上:速度慢、算力开销大。无论研究者、开发者还是普通用户,都希望模型跑一次就吐出成品。这件事之所以难,不在于网络本身不够强,而在于监督信号的组织方式。早期的一步模型很容易崩坏,表现为细节糊掉、物体种类丢失、色彩错乱,业内把这类现象统称为模态崩溃。

传统做法是让生成的图像与某一张真实图像在像素上对齐,一对一地监督。这条路在一步生成里行不通,因为一次前向计算无法同时满足所有像素的约束。分布训练换了一套思路:把图像扔进一个冻结的编码器,变成高维空间里的点,不再追究单张图好不好,而是让一整批生成图像的点云分布尽量贴近真实图像的点云分布。这是群体层面的监督,不依赖一对一的标定,因而更适合极少的采样步数。

值得说明的是,分布训练并不是要否定扩散模型的迭代过程,而是换一种监督方式来组织训练。像素级的一对一监督在极少步数下几乎无法满足,因为它要求每一次计算都同时命中所有像素的取值;而分布层面的监督只要求生成样本的整体分布贴近真实分布,这给模型留出了在群体层面逼近目标的余地,也让一步或两步生成第一次有了相对稳定的训练路径。

把两套老办法收进同一张图纸

在分布训练这条线上,此前有两个代表性方案。FD-Loss用一个大的高斯分布罩住全部特征点,计算简单、稳定好用,缺点是只能抓住全局均值与整体方差,猫、狗、飞机、花这些子模式全被揉进同一个高斯里,细粒度信息被抹平。另一条路叫高斯核漂移,落到每一个样本上,用核函数让样本之间互相吸引与排斥,能捕捉细碎的局部结构,代价是丢失全局协方差信息,还容易踩进模态崩溃的坑。

MGFlow的核心贡献是把这两者解释为同一框架下的不同选择。论文把分布训练拆成四个零件:采样样本、冻结编码器、分布模型与差异度量。FD-Loss相当于分布模型选单个高斯、差异度量选最优传输;高斯核漂移相当于分布模型选样本核密度、差异度量选KL散度。既然两者共用一套骨架,中间档位就可以被制造出来。MGFlow选用高斯混合模型,用一堆小高斯拼在一起拟合真实特征,每个组件负责一部分子模式,粒度可以自由调节,在全局矩与样本级表示之间取得平衡。

关键不是表达能力,而是样本怎么分配

一个直觉是,只要高斯混合的组件足够多,模型的表达能力足够强,问题就该迎刃而解。实验给出的答案是否定的。当各个子模式分得很开时,会出现分数失明现象:即便生成结果里某一类物体数量严重偏少,梯度更新信号也会变得微弱,算法看不到这个偏差,不会主动把样本补回来,模态崩溃依旧发生。问题根源不在描述能力,而在样本分配与组件之间缺少硬性约束。

研究团队用两块设计来补这个洞。第一块是线性规划质量约束分配:先用真实图像离线训练一套固定不动的高斯混合,每个组件天然占有固定权重,代表这类模式本该占的比例;训练每一批生成样本时,通过解一个线性规划,强制分给每个组件的样本总质量严格等于真实世界的权重。第二块是配对组件更新:生成侧的第k个组件只对齐真实侧的第k个组件,做组件对组件的定向修正,而不是笼统的全局场。再配合分层多分辨率策略,同时启用K等于1、4、16等多种组件配置,粗粒度的全局约束与细粒度的局部约束一起生效。

对已有模型做后训练就能提速

实验分成两块:ImageNet类条件生成与基于FLUX.2 4B的文生图。在ImageNet 256乘256的评测中,MGFlow明显超过FD-Loss基线,论文报告在相关配置上取得领先结果。更有冲击力的是文生图部分。原版FLUX.2 klein需要四步迭代,GenEval分数为0.794,PickScore为21.85;团队用MGFlow做后训练,只训练一千步,得到纯一步版本,开启图文联合匹配后,GenEval冲到0.900,PickScore达到21.98,一步生成的成绩超过了原来的四步模型。

这项工作的启示在于,生成领域的进步未必来自把网络堆得更大。这篇论文里主干模型完全没有改动,所有变化都落在损失函数与分布匹配逻辑上,属于典型的后训练改造。代价同样存在:组件数量K不能无限加大,否则计算开销上升,统计估计也会变得不稳定,实际工程需要在表达能力与算力之间权衡。但方向已经清晰,一步生成不是要取代迭代式扩散,而是打开另一扇门,在低延迟交互、端侧部署与大批量快速渲染这些场景里,单步推理的实用价值很高。

素材来源:智能纪元AGI、arXiv、量子位、机器之心 发布时间:2026-09-30