AI生图最让创作者头疼的时刻,往往不是"生成一张好看的图",而是"把那张差一点的图改对"。一张图看起来快能交了,偏偏一个帽子和主视觉的色号错了,海报小字糊了,人物年龄跑偏了,用户只想修一个角落,模型却把构图、光线、脸一起重画了。8月下旬,阿里千问团队开源了图像分层模型Qwen-Image-Layered,直指这个"改图全变"的行业顽疾。该模型把一张普通RGB图片自动分解成多个语义清晰、边界干净的RGBA图层,每个图层都可以独立隐藏、调色、缩放、移动、旋转甚至替换,所有操作互不影响,改完上衣颜色,模特的脸还是原来的样子,挪动促销标签,脚下的阴影一点不变形。模型已在魔搭社区和HuggingFace同步开源,支持免费商用,把AI生图从"开盲盒"变成了可灵活调整的原生分层设计文件。
传统AI修图工具的最大问题在于"牵一发而动全身"。想改一件衣服的颜色,整个画面的色调都可能偏移;想移除一个物体,边缘会出现模糊和伪影;想改海报上的文字,往往需要整张重绘。原因在于,传统视觉大模型对图像的理解停留在"扁平像素"层面,修改某个区域时,模型缺乏对图像内部结构关系的认知,只能靠全局重绘或依赖掩码的局部重绘来近似实现,结果自然不可控。而Qwen-Image-Layered换了一条思路:先"拆",再"编",把图像当作由多个独立图层叠加而成的结构来理解。
具体到实际使用,这种分层逻辑带来的体验提升是质的。以一张女装电商主图为例,模型可以自动拆出白底背景、模特身体、上衣、牛仔裤、品牌Logo、"限时5折"促销标签等多个独立图层,每个图层都是带透明通道的RGBA图像。设计师可以单独给上衣调色,不影响裤子和脸;把促销标签挪个位置,阴影和底框依然干净;把白底图层换成木纹背景,人物图层原样保留。图层还可以导出为PSD文件,直接进入Photoshop继续精修,从"生成即终点"变成了"生成后可二次加工"。有开发者实测发现,模型在本地一张RTX 3060显卡上就能流畅运行,配合ComfyUI可以快速接入现有设计工作流,部署成本远低于预期。
Qwen-Image-Layered之所以能实现接近PS原生图层的编辑精度,靠的是两项自研技术创新。第一项是RGBA-VAE编码器,它让RGB图像与透明的RGBA图层能够在同一空间内无缝通信,消除了以往多通道生成中常见的分布不均问题。传统VAE在处理带透明通道的图像时,RGB与Alpha通道的信息往往难以协调,导致生成结果要么边缘发虚,要么透明区域分布失衡,RGBA-VAE通过联合建模的方式解决了这一顽疾。第二项是VLD-MMDiT架构,它可以同时处理3到10个以上的图层,通过注意力机制在各图层之间协调,避免了逐层处理的繁琐流程,让一次前向生成即可产出完整的分层结果。
这套架构还支持递归分解,任何一层都可以被再次拆解,进行更微观的调整,相当于给了创作者无限细分的编辑粒度。第三方评测数据也印证了模型的实力:在Crello基准测试集上,Qwen-Image-Layered的四层分解RGB还原误差为0.2014,透明度区域匹配精度Alpha Soft IoU为0.5454,虽然与另一研究团队UniWorld-I2L的0.1264和0.7325相比还有差距,但相比此前"拆不出干净图层"的行业平均水平已经是明显进步。论文也坦承了当前的主要局限,包括边缘处理和密集文字识别仍有改进空间。从行业角度看,Qwen-Image-Layered的开源意义在于,它把"图层化编辑"这个过去只存在于专业设计软件中的概念,第一次以开源模型的形式交到了普通创作者手中,为AI绘画从"视觉好看"走向"生产可交付"铺平了道路。
对电商和内容营销团队来说,图层化编辑带来的直接价值是"返工成本"的大幅下降。过去生成一套商品主图,模特、背景、文案、促销标签往往需要反复重绘才能拼出一张能用的图,现在只需一次分解,就能对各个元素分别调整,围绕同一个产品做可控迭代。亚马逊、淘宝等平台要求的规格适配、多语种版本、季节性促销图,都可以在保持主体不变的前提下快速生成变体。有实操者总结,Qwen-Image-Layered在电商配图场景中,把"改文字必须整张重绘"变成了"只改文字图层",单图修改时间从分钟级压缩到秒级,对需要高频上新的店铺而言,效率提升非常可观。
UI设计和影视后期同样受益。UI设计师处理界面截图时,可以对按钮、文字、图标分别编辑而无需重绘整个界面;影视后期中的素材分层、局部修图,也能借助图层化输出减少大量手动抠图工作。更重要的是,图层化输出天然适合接入自动化工作流:图层可以导出、组合、作为输入喂给下游工具,让AI生成素材从一次性输出变成可复用的设计资产。从行业趋势看,Qwen-Image-Layered的开源与免费商用策略,正在降低中小创作者的工具使用门槛,把"专业设计能力"普惠化。当AI生图不再只是"好看的图",而是"能改、能用、能交付的图",AI绘画的生产力属性才算真正被激活。这也正是千问团队把这套模型开源时所说的:让每一个元素都像文档中的文字一样可编辑,是AI与视觉内容交互的新语言。