腾讯混元开源Editable Design,让AI画的海报文字能改、图层能拖

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

用AI生成一张海报,第一版往往足够惊艳,但只要运营说要改价格、品牌方要求把标志往右挪一点,麻烦就来了。画面里的文字、插画和背景早已压在同一张位图上,改一个局部常常意味着整张重来,而重新生成的结果即使修好了错字,也可能顺手改掉原本满意的构图。9月中旬,腾讯混元联合中山大学、清华大学、香港中文大学、上海交通大学提出Editable Visual Design方法,并开源了配套项目与代码,试图解决好看和好改只能二选一这个尴尬问题。

两难从哪来:位图没有图层,代码没有审美

传统AI生图交付的是像素。扩散模型一次性决定画面中所有元素的位置与质感,却不会把标题、价格、人物插画、背景纹理作为可继续操作的对象交出来。文字一旦被画进图片,就可能出现错字、乱码和字体不统一;想改局部只能涂抹重绘,或者整张重做。这是位图格式的固有限制,与模型画得好不好无关。

位图的这个限制在中文场景里被放得更大。中文字符笔画密集,扩散模型在渲染时容易出现笔画残缺和结构变形,字号越小、密度越高,出错概率越大。相比之下,拉丁字母笔画简单、字符数量有限,模型更容易学准。这也是为什么在营销海报这类文字密集的交付物上,直接生成的成品往往需要设计师返工重排,而英文海报的可用率明显更高。把文字从像素里解放出来,对中文设计场景的收益因此比英文场景更大。

换成让编程智能体直接写HTML,问题恰好相反。HTML天生有结构,文字可以选中,元素可以移动,样式能逐项修改,但结构不等于设计。一张复杂海报涉及视觉重心、留白、字体层级、材质和空间关系,单靠代码一步到位,很容易得到一张功能正确、审美平庸的页面。一边是有审美但改不动,一边是改得动却未必好看,两个方向的极端都无法直接进入生产流程。

分工方案:视觉模型定方向,代码建结构,智能体串起来

这套方法的核心是让两种模型各做擅长的事。视觉模型先给出构图、层级、色彩和空间关系,角色更像一位负责定方向的艺术指导,帮助智能体看清这张图应该长什么样。但参考图的像素不会直接进入最终交付物,智能体会重新生成干净的独立素材,再用语义化HTML重建文字和版式。标题仍然是真实文字,插画、背景与装饰元素各自处在独立图层中。

整个流程被拆成可检查的几步:理解需求,确定画布、信息层级与视觉方向;调用视觉模型探索构图而不是直接交付生成图;生成独立干净的视觉素材;用HTML重建版式和真实文字;实际渲染成图并观察问题;通过检查后连同编辑器与过程记录一起交付。最关键的变化是生成不再止于出图,同一个智能体从理解需求一路负责到渲染、检查和修复,如果标题挤出边界或图层没有对齐,它需要继续调整,而不是把第一版当作答案。

交付物变了:双击改字,单独拖图层,过程还能回放

打开最终文件后,用户可以直接双击修改文字,也可以单独选择和拖动插画、背景、装饰与文本图层。因为交付物保留了语义结构,局部修改不需要重新生成整张图,改一处不会牵动全局。这一点看似朴素,却是设计协作里最刚性的需求:品牌方调整一个标志位置,不应该触发一轮新的生成抽卡。

项目还提供了一个名为Agent Design Replay的能力。它记录的不是简单聊天日志,而是从需求理解、构图规划、素材生成,到代码实现、渲染观察和局部修复的完整路径。用户不仅能看到成品,也能知道智能体为什么这样排版、中途发现过什么问题、后来如何修正。对生成式设计工具来说这一点并不常见,多数产品只能看到输入和输出,中间过程几乎是黑盒。当生成结果要进入真实生产流程时,可追溯和可修改往往与第一眼的视觉效果同样重要。

14组案例暴露真实短板:中文密集排版与长文案

项目仓库目前展示了14组案例,覆盖营销活动、信息设计、文字型设计、海报、学术海报与艺术设计六类任务。选例刻意挑了AI生图最容易露怯的场景:大量中文、密集信息、价格数字、表格化模块,以及需要严格层级关系的长文案,包括茶饮新品与电商护肤品海报、小熊猫百科、纽约三日攻略、滕王阁序全文海报等。

这类任务最难的往往不是画得够不够漂亮,而是文字能否准确、信息能否完整、后续能否改动。结构化交付把问题从要求模型一次画对所有字,变成了让文字从一开始就保持为文字。为了避免看着差不多就直接交付,项目还设置了确定性检查,覆盖画布尺寸、字体、图层约定、实际渲染以及编辑器往返操作。编辑能力因此不是演示视频里的特效,而是交付格式本身的一部分。仓库已提供配套的智能体技能,源文件结构允许时还可进一步导出为元素独立可选的演示文稿格式。

下一步不是生成更大的图,而是让图能接着用

过去两年,图像生成模型一直在比拼分辨率、真实感和指令遵循,评价维度都指向同一次输出的质量上限。可编辑设计提出的则是另一个问题:一张图生成之后,能不能自然地进入接下来的工作。真实的设计流程很少在第一次出图时结束,文案会改、素材会换、比例要适配不同渠道,同一套视觉还要衍生出多个版本。

只交付像素,意味着模型完成了创作的前半程,却把后半程重新留给了人。结构化、可编辑的生成式设计试图把这条链路再往后推一步:视觉模型提供审美先验,代码承接结构,智能体在两者之间持续观察和修正。它未必会取代专业设计软件,也不是要把每个设计师都变成前端工程师,更现实的意义在于当AI参与设计时,交付物终于不必只有一张PNG。从帮我画一张图到给我一份还能继续改的设计,这可能是AI设计真正走进生产环节的起点。

素材来源:机器之心、科技行者、搜狐科技、新浪财经 发布时间:2026-09-20