阿里在AI视频开源赛道再次加码。7月30日,阿里巴巴正式开源视频生成模型通义万相Wan2.2,此次开源包含三款核心模型:文生视频模型Wan2.2-T2V-A14B、图生视频模型Wan2.2-I2V-A14B,以及统一视频生成模型Wan2.2-IT2V-5B。其中文生视频与图生视频模型总参数量达270亿,激活参数140亿,均为业界首个使用混合专家架构的视频生成模型,标志着视频生成技术迎来重大架构突破。
开发者可在GitHub、HuggingFace、魔搭社区下载模型权重与代码,企业可通过阿里云百炼调用API,普通用户还可在通义万相官网和通义App直接体验。自今年2月以来,通义万相已连续开源文生视频、图生视频、首尾帧生视频和全能编辑等多款模型,累计下载量超500万次,此次Wan2.2的发布进一步巩固了其在开源视频生成领域的位置。
Wan2.2最核心的技术创新,是率先在视频生成扩散模型中引入MoE混合专家架构,有效解决了视频生成处理Token过长导致的计算资源消耗过大问题。该架构由高噪声专家模型和低噪声专家模型组成,分别负责视频的整体布局和细节完善:高噪声阶段,专家模型聚焦全局结构与运动轨迹;低噪声阶段,专家模型专注细节纹理与光影打磨。这种分工协作机制,让模型在同参数规模下节省约50%的计算资源消耗。
效率提升的同时,生成质量不减反增。官方在Wan-Bench 2.0基准上的测试显示,Wan2.2在复杂运动生成、人物交互、美学表达等维度实现显著提升,大多数关键评测维度超越主流商业模型。团队还透露,Wan2.2相较前代Wan2.1训练数据大幅扩充,图像数据增加65.6%,视频数据增加83.2%,更丰富的数据让模型在运动、语义与美学的泛化能力上全面增强,这也是其在基准测试中实现全面领先的基础。
除了架构创新,Wan2.2的另一大亮点是首创的电影美学控制系统。该系统在光影、色彩、构图、微表情等方面达到专业电影水平,用户通过输入黄昏、柔光、边缘光、暖色调、中心构图等关键词,模型即可自动生成金色落日余晖的浪漫画面;使用冷色调、硬光、低角度等指令组合,则能生成接近科幻片的画面效果。这种可量化的美学控制能力,让创作者不再依赖抽卡式的反复尝试,而是能够像导演一样精确指挥画面风格。
美学控制能力的背后,是团队对高质量美学数据的精心构建。Wan2.2的训练数据包含了细致的标注信息,涵盖光照、构图、对比度、色调等多维度特征,模型据此学习到美学要素与画面效果之间的映射关系。对于影视、广告等专业创作者而言,这意味着AI视频生成从碰运气走向了可编排,导演可以在生成前就锁定画面的视觉语言,大幅降低后期调色与返工成本。
此次开源最令人惊喜的,是5B参数统一视频生成模型的轻量化突破。Wan2.2-IT2V-5B采用高压缩率3D VAE架构,时间与空间压缩比达到4乘16乘16,信息压缩率提升至64倍,均实现开源模型的最高水平。该模型仅需22GB显存,单张消费级显卡即可运行,数分钟内可生成5秒720P分辨率、24帧每秒的高清视频,是目前该分辨率与帧率下生成速度最快的基础模型之一。
这一突破的意义在于,AI视频生成的技术门槛被大幅拉低。过去,视频生成模型动辄需要数十张专业显卡,普通创作者与中小团队只能望而却步;如今一张RTX 4090级别的消费级显卡就能本地跑通,数据不出设备,隐私与成本问题同时得到缓解。当全球首个MoE视频生成模型开源、5B模型单卡可跑,AI视频生成正在从大厂特权变成人人可用的基础设施,这场由阿里推动的开源浪潮,有望重塑整个视频生成产业的竞争格局。
通义万相Wan2.2的开源策略,正在改写AI视频生成市场的竞争规则。在闭源模型主导的年代,创作者使用顶尖视频生成能力只能按量付费调用API,成本高昂且受制于供应商政策;开源模型的出现,让开发者可以自由部署、定制与二次开发,将视频生成能力嵌入自有工作流。Wan2.2同时提供API调用与开源权重两种方式,兼顾了企业用户与开发者社区的不同需求,这种开源加云服务的双轮策略,正在成为大厂布局生成式AI的标准打法。
从行业影响看,开源视频模型的意义不止于技术普惠。它让学术界能够深入拆解MoE架构在视频生成中的实现细节,加速技术迭代;让中小团队能够在Wan2.2基础上构建垂直应用,丰富整个生态;也让国内视频生成技术在全球开源社区获得更大的话语权。此前通义万相系列累计下载量已超500万次,Wan2.2的发布有望将这个数字推向新的高度,社区中已经出现基于Wan2.2的微调与二次开发项目,覆盖动漫风格化、广告分镜等垂直场景。当视频生成从黑箱服务走向开放生态,竞争的重心将从模型参数比拼,转向应用场景与生态建设的较量,而阿里已经在这条路上占得先机。