千问开源Qwen-Image-2.1,7B小模型拿下开源生图第一

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

AI生图的瓶颈早就不在画得好不好看。对设计师、电商运营和内容创作者来说,真正的卡点是一张图能不能被继续修改:人物要抠出来、素材要改字、商品摆放要调整而包装上的字和瓶身形状不能跟着变。每一次修改指令能否被准确执行,决定了AI生成的内容能不能进入真正的创作流程。9月20日,阿里千问开源了图像模型Qwen-Image-2.1,正面回答的就是这个问题。

把生图和修图合成一个模型:7B参数怎么做到的

Qwen-Image-2.1把文生图与图像编辑整合在同一套权重里,视觉生成部分采用20层单流扩散Transformer,参数量为7B,原生支持2K分辨率。它没有走堆参数的路子,而是靠结构设计和推理优化在生成质量与计算成本之间取平衡,官方称这是千问图像系列当前最平衡、性价比最高的开源生图模型。

技术上的关键取舍是注意力机制。模型对文本用词元级因果掩码,对图像用分块级掩码,配合键值缓存复用机制,在多图输入场景下明显改善了推理效率与显存开销。这也解释了为什么一个7B模型能同时吃下最多10张参考图而不至于算不动。

参数量小带来的是硬件门槛低。在单张24GB显存的消费级显卡上配合CPU卸载,模型生成一张1024×1024图像约需18.7秒,完成一次图像修改约需21.7秒。对中小设计团队来说,这个量级意味着可以在本地跑通流程,而不必把素材全部上传到云端服务。

接口层面,模型提供了兼容OpenAI的调用方式,同时上线即支持ComfyUI、vLLM-Omni与SGLang-Diffusion。这种首日适配的做法降低了试用门槛,开发者不需要等待社区补齐适配就能直接跑通流程。

透明图层与10张参考图:解决的是设计流程里的真问题

原生支持透明图像是这次更新里最实用的一项。模型可以根据提示词直接生成带Alpha通道的图片,也支持透明图层编辑与抠图,输出格式为RGBA。对做海报、电商主图、包装设计的人来说,透明图层省掉的是导出后再抠一遍的工序,而不是视觉上的小改进。

多参考图能力针对的是另一类痛点。最多10张参考图可以在一次生成里同时输入,配合圈选、涂抹或独立掩码指定区域,模型能够强化局部编辑以及人像与商品的一致性。官方给出的例子是用十张家居参考图生成室内布置方案,这类任务过去需要设计师在多个软件之间反复导入导出。

编辑任务覆盖面也做了扩展,从局部的文字替换、元素增删,到全景图、信息图与分镜生成都能承接。文字渲染、人物光影与细节表现是这次重点优化的方向,这两项恰好是国产图像模型长期被诟病的地方。

多参考图的实用价值集中在风格统一上。电商场景里,同一个商品需要在不同背景、不同模特、不同光线下呈现,如果每次生成都重新理解主体,结果就会飘。把参考图作为约束条件输入,等于给模型提供了可对照的锚点,这也是把AI生成结果用于批量生产的前提。

60.28分背后:小模型为什么能压过大模型

在公开评测Qwen-Image-Bench中,Qwen-Image-2.1总分60.28,取得开源模型第一。作为对照,Nano Banana 2.0为59.82,GPT Image 1.5为59.65。视觉生成部分只有7B参数的模型能够与多款闭源图像模型同场竞争,说明这一代图像模型的能力增长已经不再主要来自参数规模。

原因在于训练数据的组织方式与任务定义的变化。文生图与图像编辑共用一套权重,意味着模型在学习生成时就同时在学习理解编辑指令,两类任务共享表征,等于用一份参数解决两个问题。相比之下,把生成与编辑拆成两个模型的做法,会在任务切换处产生信息损失。

开源策略本身也值得注意。权重按研究许可发布,商用需要单独授权,同时模型上线即获得ComfyUI、vLLM-Omni与SGLang-Diffusion的支持,并提供兼容OpenAI的接口。先让社区能跑起来、再谈商业化,是过去一年国产开源图像模型的通用路径。

AI生图竞争的重心正在从出图转向改图

把这次发布放回9月的AI绘画赛道看,方向变化很清楚。9月15日Ideogram发布开放权重的文生图基础模型,把重点放在英文文字渲染与结构化提示;9月18日PixAI推出Tsubaki.3,把参考图与角色一致性做到跨图像、漫画与视频;9月20日腾讯混元开源可编辑设计方法,让AI生成的海报文字能改、图层能拖。这几件事指向同一个判断:单张图的惊艳程度已经不是差异化来源,能不能被连续修改、能不能保持一致性才是。

这对使用方的意义更直接。过去采购AI生图工具看的是样张好不好看,现在需要看的是它能不能接入既有设计流程:图层是否可编辑、文字能否保真、商品主体能否在多张图之间保持一致、修改一次要等多久。这些指标决定的是实际产能,而不是观感。

对国产模型来说,真正的机会窗口在电商与本地化设计。中文文字渲染、商品保真、多参考图组合布置,都是国内设计场景的高频需求,也是海外模型相对薄弱的部分。把这些场景做透,比在通用榜单上争几分更有价值。

素材来源:机器之心、IT之家、DoNews、AI Intel Report 发布时间:2026-09-21