2026年7月17日,阿里巴巴集团Wan团队以技术报告形式发布了WanSong v1.0,一款基于纯扩散模型、能一口气生成长达5分钟商业级歌曲,并同步输出独立人声和伴奏音轨的AI音乐系统。与Suno和Mureka等主流AI音乐平台采用的自回归技术路线不同,WanSong彻底抛弃了AR加多阶段流水线的架构,纯用扩散模型一步到位。这一架构选择从根本上解决了长音频生成中的累积误差问题,标志着AI音乐正式进入了长格式创作时代。
要理解WanSong解决了什么问题,得先了解目前主流AI音乐平台的核心技术。Suno和Mureka等平台采用自回归模型为基础架构。自回归模型的工作方式就像一个逐字写信的人,先产生第一个音频片段,然后根据前一个片段决定下一个,以此类推,一个片段一个片段地接续下去。这种方式严谨且合理,但有两个致命缺陷:速度慢,而且越到后面累积误差越大。一首只有20秒的片段还能勉强撑住,但要生成5分钟的完整歌曲,这个累积误差足以让整首歌的质量急剧下降。研究人员发现,在自回归模型生成的歌曲中,后半段的人声往往会偏离音轨、伴奏变得稀碎、整体听感像是信号不良的广播。一些系统尝试采用AR加扩散的组合路线,先用AR生成粗糙的骨架,再用扩散模型打磨细节。这种方式有所改进,但本质仍是多阶段流水线,前一个阶段的错误会传递给下一个阶段,整个系统变得复杂且难以控制。阿里巴巴团队决定绕开这条路。既然扩散模型在图像生成领域已经证明了端到端极高质量的能力,为什么不把同样的逻辑搬到音乐生成上?纯粹用扩散模型一步到位,不依赖自回归模型,不需要多阶段流水线,让模型在同一个计算空间中一次性生成完整的音乐信号。
WanSong的生成逻辑从根本上改变了音乐AI的技术路径。在扩散模型中,先从一个纯噪声信号开始,然后通过多步去噪过程逐步还原出清晰的音频内容。WanSong的创新之处在于,它通过在模型中引入特殊的结构约束条件,让去噪过程不仅还原出高质量的音频,还能自动分离出人声和伴奏两个独立音轨。这意味着WanSong生成的歌曲天然就是分轨的,用户可以直接对伴奏和人声分别进行编辑。5分钟歌曲的生成涉及的计算量非常巨大。以44.1kHz的采样率计算,5分钟的立体声音频需要生成超过2650万个采样点。WanSong选择在梅尔频谱空间中操作,将高维的音频信号压缩到较低维度的频谱表示,再通过专用的声码器将频谱还原为可听的音频。这种频域操作方式相比时域直接生成大幅降低了计算复杂度。另一个技术难点是保持长时程的音乐结构一致性。5分钟的歌曲通常包含前奏、主歌、副歌、桥段、尾奏等多个段落,每个段落中的旋律、节奏和配器都需要在保持整体连贯性的同时产生适当的变化。WanSong通过在训练阶段引入音乐结构标注,让模型学会了从全局视角组织音乐的段落推进。据技术报告披露,WanSong生成歌曲的结构完整性和段落过渡的自然度在多项指标上优于现有的自回归基线模型。
WanSong的发布将对AI音乐生态产生多方面的影响。对于专业音乐人来说,一项关键变化是,AI终于可以生成完整的歌曲,而不仅仅是片段和demo。过去AI音乐的主要用例是为创作者提供灵感片段或背景音乐素材,现在它可以真正作为协作搭档参与完整作品的创作过程。对于AI音乐平台的竞争格局来说,WanSong的出现可能改变市场力量的配比。Suno、Mureka和Udio等平台已经构建了各自的用户生态和商业体系,但它们的技术路线都建立在自回归模型之上。如果扩散模型路线被证明在长格式歌曲生成上具有系统性优势,这些平台将面临技术路线的迁移压力。WanSong的开源状态也是一个关键变量。虽然目前WanSong以技术报告的形式发布,但根据阿里巴巴在AI开源领域的一贯做法,模型权重有较大可能性向社区开放。如果WanSong成为开源项目,全球的AI音乐开发者和创业公司将能够基于这套技术构建各自的音乐产品,AI音乐的创新速度将进一步加快。在AI音乐产业化的进程中,WanSong代表了技术路线的多元化。自回归路线和扩散路线将在2026年下半年展开正面竞争,而竞争的结果将在很大程度上决定未来几年AI音乐的技术走向。对一个年增长率超过50%的市场来说,基础设施级别的技术突破通常意味着新商业机会的集中涌现。对于独立音乐人和小型工作室而言,WanSong的纯扩散路线可能意味着未来不需要支付高昂的自回归模型授权费用,就能生成完整的商业级歌曲。这种民主化的技术路径将进一步推动AI音乐创作的普及。
WanSong v1.0的发布不仅是一个技术事件,更是一个对AI音乐行业标准产生深远影响的事件。自回归模型一直是AI音乐生成的事实标准,Suno、Mureka和Udio等主流平台都在这一技术框架下构建了各自的产品。WanSong证明了扩散模型路线在长格式音乐生成任务上具有系统性的优势。如果这一验证得到更多第三方评测的确认,AI音乐行业的核心技术路线可能面临重新选择。对于AI音乐评测标准来说,WanSong也提出了新的挑战。过去AI音乐的评价主要关注20到30秒片段的声音质量和风格还原度,但WanSong将评价尺度拉长到了5分钟的全曲。全曲的结构完整性、段落推进的逻辑性和情绪表达的连贯性,成为了新的评价维度。这预示着AI音乐的评测标准将从业内常见的片段质量评测向全曲质量评测演进。对于整个音乐产业来说,能够生成完整歌曲的AI系统意味着创作者可以用AI完成从灵感构思到成品输出的全流程,音乐创作的生产效率将迎来一次质的飞跃。