9月15日,阶跃星辰发布了StepAudio 3系列模型,一次推出五款新品,覆盖语音交互与音频内容生产的完整链路。五款模型均已上线阶跃星辰开放平台。这次发布的密度在国产语音模型里并不多见,它不再只补某一项单项能力,而是把听说读写创五个环节同时铺开。
发布方的判断是,过去一年语音大模型正从单项的语音识别与生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争。随着这一系列上线,阶跃星辰的音频产品版图覆盖了听、说、理解、推理和创作五个方向。这个说法背后有明确的行业背景:当识别与合成的准确率普遍进入可商用区间,竞争焦点就从能不能做转向能不能在同一套体系里把多个环节串起来。
系列中最受关注的是StepAudio 3 Realtime,它支持原生全双工实时对话,能够同时理解语义、语气、情绪及环境音,在Artificial Analysis榜单中综合得分98.9%,位列全球第一。全双工意味着模型可以边听边说,而不是等对方说完再开始处理,这是语音交互体验的分水岭,也是延迟最敏感的一段能力。
另一项硬指标来自识别。StepAudio 3 ASR融合大模型的上下文理解能力,支持方言、中英混说以及医疗、法律等专业场景,词错误率低至1.7%,在Artificial Analysis非流式语音识别准确性榜单中并列全球第一。词错误率越低意味着转写错误越少,1.7%这个数字说明头部模型之间的差距已经进入千分位,区分度更可能落在榜单之外的方言覆盖数量、混说时的切换质量以及专业术语是否需要额外配置上。
StepAudio 3 TTS面向真人级语音生成。除了音色、语调、节奏、停顿和情绪表达这些常规维度,它还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。这些细节此前大多被当作瑕疵处理,而在有声书、播客与客服这类长时段语音场景里,正是它们决定了一段合成语音听起来是不是活人。
流式架构对模型本身也提出了额外要求。非流式生成可以等整句话的语义完整后再决定语气与停顿,流式生成则必须在只听到前半句时就开始输出声音,模型要一边接收上下文一边调整韵律。这解释了为什么实时语音产品的体验差异往往不在音色,而在断句与重音的位置。如果模型对语义边界的判断慢半拍,用户听到的就是频繁的截断与重来;如果它为了稳妥而等得更久,首字延迟又会吃掉实时感。这项能力考验的是模型在信息不完整时做判断的稳定性。
该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用的需求。流式带来的工程价值很直接:语音产品不必等整段音频生成完毕再开始播放,首字延迟大幅缩短,弱网环境下也更容易做缓冲策略。对做实时语音助手的团队来说,这一项往往比音质指标更能决定产品能否上线。
StepAudio 3 Gen解决的是声音元素的拼接问题。它把人声、音效、环境声和背景音乐等原本分散的生成环节整合到一起,用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序。适用场景覆盖影视、动画、游戏、广播剧、有声书和短视频等内容生产环节。
把四类声音放在同一个模型里处理,反映的是音频生成正在从单点工具变成统一底座。语音、音效、歌声与环境声在物理上同源,都是波形,分开训练意味着要为每一类声音维护独立的模型与数据管线。统一之后最直接的变化是可以做跨类型的组合任务,例如给一段人声补上匹配的空间混响,或者让配乐随对话节奏自动调整强度,这类任务在分开建模的体系里很难表达。
面向音乐创作的StepAudio 3 Music则不再局限于一句话生成一首歌,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于ABC记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代。ABC记谱法这条路径值得留意,它让模型先拿到一份可编辑的乐谱结构再渲染音频,把音乐生成从一次性抽卡变成可迭代的创作过程,这与过去一年AI音乐从生成完整歌曲转向参与实际生产流程的趋势一致。
把这次发布放进国内语音模型的技术路线图里看,分化正在出现。腾讯混元此前开源过AuK这类统一语音生成与编辑模型,小米开源过多说话人识别模型,通义的语音模型加进了工具调用能力;阶跃星辰这次五款模型没有放出权重,而是直接挂在自家开放平台按API调用。对不打算自建推理集群的团队来说,接入门槛更低,代价是模型跑在别人的机器上,长期成本与可控性需要自行权衡。
真正决定开发者要不要接的通常还有三件事:实时对话的端到端延迟能压到多少毫秒、语音合成的音色能不能自定义、音频生成产出的音效有没有明确的商用授权。这三项在本次发布里都没有给出具体口径,需要等开放平台的文档。此外,音乐创作一旦进入商业发行,AI生成内容的版权归属如何界定仍是悬而未决的问题。榜单上的第一名能证明技术位置,但能不能把技术优势变成商业壁垒,取决于这些没有写进发布稿里的细节。