蚂蚁开源6B统一图像模型,文本生成与指令编辑一肩挑,训练配方全公开

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

9月4日,蚂蚁集团旗下AI开源社区inclusionAI正式发布并开源了统一图像生成与编辑模型LLaDA-Image,同步在Hugging Face开放权重、在GitHub公开推理代码,并附带一份罕见的完整训练配方。该模型总参数6B,采用单流扩散Transformer架构,用同一个模型覆盖文生图、指令引导编辑与双语海报排版等任务,团队宣称其在Qwen-Image-Bench评测上创下开源模型新纪录,英文与中文赛道分别拿下53.53与53.38的综合分。

不用大量图文对也能训出好模型,配方首次全公开

LLaDA-Image最引人关注的地方不在参数规模,而在训练路线。主流文生图模型通常依赖海量图文配对数据完成对齐,而inclusionAI采用了纯图像预训练加中期训练的策略,先用约2.2亿张图像样本建立扎实的视觉先验,其中98%为真实图像,随后才引入成对的语言监督与生成编辑联合训练。论文称,这一课程式设计让模型在语言对齐之前先学会绘画本身,从根源上缓解了图文对数据质量参差带来的不稳定。

训练配方的完整公开在开源社区激起不小涟漪。权重开源常见,但把数据流水线、训练流程与设计取舍事无巨细地写成文档却极为稀缺,多数实验室对此讳莫如深。LLaDA-Image论文详细记录了数据配比、优化器选择与蒸馏细节,任何研究团队都可以照着配方复现和改造,这让它不只是又一个模型,更成为一套可学习的开源方法论。对算力有限的中小团队而言,这份配方降低了复制顶尖图像生成能力的门槛。

扩散语言模型做文本编码器,架构上的一次大胆尝试

架构层面,LLaDA-Image采用了一个颇具实验性的组合。视觉理解模块基于LLaDA 2.0 Mini扩散语言模型构建,规模约2B且全程冻结,负责解析复杂提示词;生成部分则是从头训练的6B单流扩散Transformer,采用参数无关的RMSNorm与Muon优化器保障训练稳定。也就是说,文本编码器与图像生成骨干都是扩散模型,这在当前以自回归语言模型做编码器为主流的行业里属于少见的路线。

团队选择这条少走路线的理由相当务实。让编码器与生成骨干共享扩散血统,意味着蒸馏、采样加速与推理优化可以复用同一套工具链,Twin-DMD这类跨模块的蒸馏方法也因此更容易落地;而LLaDA系列在长文本理解与多语言提示上的表现,已经为扩散语言模型充当条件编码器积累了可信的验证记录。尽管扩散编码器的推理成本高于自回归方案,团队认为在可控性与生成质量的收益面前,这笔开销是值得的取舍。

两个模块之间通过残差查询适配器与浅层Transformer连接器对齐语义空间与生成空间。图像编辑任务则绕过语言模型直连参考图,经由SigLIP-VQ编码器把视觉特征注入扩散骨干,在忠实保留主体内容的前提下响应文字修改指令。团队还发布了采用Twin-DMD蒸馏的Turbo变体,把采样步数压缩到2至4步,让实时交互式的生成与编辑成为可能,兼顾高保真输出与低成本部署两种诉求。

从学术开源到应用落地,扩散路线的新想象

开放生态的响应速度相当快。权重发布后数小时内,社区便贡献了面向llama.cpp、LM Studio与Ollama的多个量化版本,独立开发者还搭建了浏览器端在线工作区,用户无需本地配置即可体验文生图、指令编辑与中英双语海报生成。模型对文字渲染与中文排版的侧重,也让它在国内海报、电商物料与本地化创意场景中具备天然的落地优势。

从更大的棋盘看,LLaDA-Image是蚂蚁开源战略的又一步。蚂蚁此前已开源LLaDA系列文本模型,此次把触角伸向图像领域,意在构建覆盖文本与视觉的统一开源版图,为旗下AI应用与开发者生态储备底层能力。对一家以支付与数字金融起家的公司而言,通过开源建立技术影响力、吸引开发者共建生态,是在大模型竞赛中缩小与头部玩家差距的务实路径,也让这次发布多了一层生态卡位意味。

行业观察人士认为,LLaDA-Image的意义不仅在于又一个开源模型的诞生,更在于它验证了一条摆脱巨量图文对依赖的可行路径。当数据成本成为开源社区与大厂实验室的共同瓶颈,以纯图像预训练建立视觉先验再逐步对齐语言的课程式方法,可能为下一代图像模型的训练打开新窗口。inclusionAI也表示,将持续迭代这套统一扩散框架,让生成与编辑在同一个模型里走得更远。

中文渲染成为硬指标,开源模型的差异化战场

LLaDA-Image把中文渲染当成一项硬指标来打磨。团队在论文中特别强调双语海报与文字排版能力,评测也按英文、中文两条赛道分别计分,这在以英文为主的图像模型评测生态里并不多见。对国内用户而言,海报上不出现错别字、复杂版式不被打乱,往往是比画质更先被感知的体验,中文语料的渲染能力因此成为开源模型在国内落地的第一道门槛,也是许多海外模型表现欠佳的软肋所在。

一旦这道门槛被迈过,应用想象空间随之打开。电商主图、社媒配图与营销海报这类高频轻量需求,并不需要电影级画质,却极度依赖文字准确与版式可控,正是统一生成编辑模型的主场。inclusionAI把评测基准、模型权重与训练配方一并开放,等于把方法论也交到社区手中,后续基于LLaDA-Image的中文图像应用与二次训练,有望形成一条由国内开发者主导的开源生态链,这也是这轮发布最值得长期观察的地方。

素材来源:机器之心、AGI Hunt、The Next Gen Tech Insider、The Open Weights 发布时间:2026-09-06