打开Midjourney或FLUX生成图片时很少有人注意到这些工具在幕后思考了许多步。扩散模型可能需要走上二十步甚至五十步才能画出一张图。EPFL与Valeo.ai及索邦大学联合研究彻底改变了这个局面。名为表征分布匹配的方法首次实现了单步生成质量超越四步模型的里程碑。
现有主流扩散模型让AI学习一步步把噪声变成图片的过程。RDM的思路完全不同:直接约束最终结果的分布而不是中间过程。iRDM版本引入轻量级修正器对生成结果微调,只需极少的计算量就能显著改善输出质量。
在标准基准测试中RDM单步生成质量显著优于传统扩散模型在同一步数下的表现,且超越了传统四步模型。推理延迟降低75%以上。对移动端和实时交互场景的价值尤为突出。
推理成本大幅降低将推动AI绘画功能普及。对于日均调用量10万次以上的电商图片生成场景每月可节省数十万元推理成本。同时单步生成低延迟特性也解锁了实时视频风格转换等此前难以实现的应用场景。