9月22日,腾讯混元发布图像生成模型Hy Image3.5 preview。这款模型支持文生图、图生图与多轮对话创作,单次最多可上传5张图片作为参考,支持多种尺寸比例输出,最高实现2K分辨率。真正让它在发布当天就被大量讨论的,是价格:腾讯云API的2K图像定价为0.15元一张,且只对最终输出的图片收费。
把价格放进同行对比里更容易看出位置。按各家官方公开定价整理,在13款主流生图模型中,Hy Image3.5 preview的单张2K图片生成成本最低。作为参照,GPT Image 2.5的low档约为0.162元一张,Qwen-Image-3.0约为0.2元一张。腾讯云国际版的定价为0.024美元一张。
低价的实现路径不是简单补贴,而是架构与部署层面的工程优化。官方说明,该模型采用简化的架构,结合高效蒸馏算法,并把文本与图像两个分支做解耦部署,同时针对注意力算子做适配,从而提升推理资源利用率。蒸馏的作用是把大模型的生成能力压缩进更小、更快的结构,解耦部署则让不同分支可以按各自的算力需求调度,避免资源浪费。
只对输出计费这一条对实际使用成本的影响,可能比单价更大。图生图与多轮编辑场景通常需要反复尝试,如果参考图上传也计入计费,单张成品的实际成本会被显著抬高。按输出计费意味着企业可以放心上传素材、多次调整,成本只与最终交付的图片数量挂钩,这让预算测算变得可预测。
相比上一代Hy Image3.0,新版本重点提升了文本渲染与布局、真实感与风格表现力、编辑一致性,以及语言与视觉的理解能力。这些改进集中指向同一个使用场景:不是生成一张好看的图,而是把一张图改成可交付的物料。
多轮对话创作是这次更新的核心交互变化。用户可以先生成一张海报,再改文字、换元素、调版式,模型结合前面的对话继续修改,不必每次从头开始。官方称模型基于历史上下文进行连续创作与编辑,这意味着一次改图的成本从重新抽卡变成一次增量编辑。
参考图数量上限提升到5张,直接对应的是多主体编辑与风格迁移场景。同时给模型更多人物、风格、构图上的视觉参考,可以让生成结果更接近使用者的想法,这在电商物料、品牌视觉这类对一致性要求高的场景里尤其关键。广告侧反馈称,模型在图生图场景下对指令的理解更好,文字乱码与图片重绘异常等问题的比例下降7%,输出更稳定。
多轮编辑对交互设计还有一个隐含要求,就是记忆的范围。如果模型只记得上一轮指令,用户改到第三轮就会丢掉最初的目标;只有把整段对话的意图持续保留,改图才不会越改越偏。这也是这类产品从单次生成工具转向长期创作伙伴的关键分界。
腾讯内部组织了数百名专业设计师进行GSB盲测。结果显示,Hy Image3.5 preview相比Hy Image3.0的综合表现提升约30%;与字节的Seedream 5.0 Pro表现持平,并略优于Nano-Banana Pro与Qwen-Image-3.0 Pro。这些结果来自腾讯内部测试,属于厂商自评,独立复现仍需等待第三方评测。
灰度阶段的数据提供了另一种验证。该模型在腾讯元宝中提前两个月逐步上线,官方称灰度期间生图整体请求量提升超过50%;在对精准编辑要求更高的人像修图场景,请求量提升100%;小字渲染能力的提升带动海报制作、Logo生成等生产力场景请求量提升80%。请求量的增长说明模型被真实用户反复调用,而不只是发布时的演示。
接入范围覆盖了腾讯内部的多个AI应用:元宝、专业影视智能平台WorkRally、剧集与游戏内容制作工具OnSolo、创意智能体Miora、办公智能体工作台WorkBuddy以及知识管理产品ima。面向企业开发者,API已上线腾讯云TokenHub、媒体处理MPS与云点播VOD。WorkRally首发接入并向平台创作者提供两周免费体验,覆盖剧集分镜、影视物料、角色与场景设定等专业创作环节。9月20日在腾讯视频上线的AI精品剧《行镖》采用真人实拍与AI生成结合的方式,其中分镜生成、素材融合与多版本镜头迭代均在WorkRally上完成。
把这轮更新放进混元的整体节奏里看,能看出迭代方式的调整。自今年2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本,并采用预览版先行、正式版跟进的方式,把真实业务中的反馈持续带回研发。8月发布的Hy4 preview走的是开源大语言模型路线,这次图像模型更新则是多模态方向的继续加速。
行业层面的竞争重心也在移动。当主流模型的出图质量趋于接近,差异化的空间就从生成转向编辑:能否在多张参考图的约束下保持风格统一,能否在局部修改时不破坏整体一致性,能否把文字、图层与版式控制到位。这些能力直接决定AI生成内容能否进入电商批量生产、影视分镜、UI设计等真实管线,而不是停留在创意草稿阶段。
国产模型在这一转向中呈现出一个共性特征:把价格压到足够低,同时把能力对准具体的生产场景。对国内设计团队与中小企业而言,单位成本可预测、参考图与编辑能力够用、能直接接入既有办公与创作工具,这三点的组合比单纯的画质排名更有实际价值。需要观察的是,内部盲测的领先能否在更广泛的第三方评测中复现,以及多轮编辑在复杂版式上的稳定性是否经得起长期使用。