ElevenLabs发布Eleven v4:90多种语言,10秒音频即可克隆声音

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

9月29日,语音AI公司ElevenLabs发布第四代语音模型Eleven v4,同步推出面向实时对话的v4 Turbo。新模型的口径可以浓缩成三个数字:语言覆盖从上一代的70种扩展到90多种;即时声音克隆所需的最短音频从数十秒降到10秒;Turbo版本的端到端延迟压缩到适合实时来回对话的水平。三者叠加,语音生成的工具门槛又被拉低了一档。

10秒克隆:能力边界与使用边界

10秒是什么概念?一条微信语音、一段短视频里的几句台词、一次会议录音的开头,都足以凑齐克隆一段声音的原料。Eleven v4在克隆保真度上也有所提升,官方与媒体反馈显示,日语、巴西葡语、普通话与粤语是这一代质量提升最明显的语言,用一种语言录制的声音可以另一种语言说话,同时保持说话人的身份特征。

对创作者来说,这是实打实的生产力。视频博主可以把同一条内容低成本配音成多个语言版本,不需要租棚、不需要配音演员二次排期;有声书与游戏工作室可以用克隆声音批量产出多语言版本,声音一致性由模型保证。跨语言保持身份这一项,对出海内容团队尤其有价值。

另一面是滥用的风险敞口。声音克隆诈骗在此前多个市场已经造成真实损失,受害者接到的是亲人或上司的声音,要求紧急转账。10秒的克隆门槛意味着防伪的难度进一步上升,普通人几乎无法凭听觉分辨克隆声音与真声。技术公司的水印、验证与授权机制建设,速度需要跟上能力迭代的速度。

Turbo与表演指令:往实时与专业两端走

v4 Turbo的定位是实时对话。语音智能体当前最大的体验瓶颈就是延迟,用户说完一句话,等待回复的时间超过一秒就会明显感觉到在跟机器说话。Turbo版本把生成延迟压到可来回对话的水平,配合此前公司披露的语音智能体业务,等于把工具链补齐到了可以支撑电话级应用的环节。

v4还支持在生成过程中插入表演指令,用户可以在文本里标注停顿、语气与情绪走向,让模型按导演意图朗读。这个功能看起来细微,实际上是向专业配音市场靠近的关键一步。配音工作的核心从来不只是把字念对,而是表演,能不能被导演用行业语言指挥,决定了AI语音能否进入专业工作流。

语言覆盖的扩展背后是数据与标注的投入。小语种的高质量语音数据稀缺,90多种语言的覆盖意味着公司持续在做数据采集与母语者标注。此前公司披露过雇佣数千名外部人员做手工标注,以提升情感表达与口音的准确性,这一代语言质量的跃升正是这类投入的产出。

财务数字与行业位置

这次发布也放在一家高速增长的公司背景下。ElevenLabs此前披露年化经常性收入已达6亿美元,其中企业客户贡献超过一半,估值在数月内翻倍。语音是当前AI应用里商业化最清晰的赛道之一,客服、有声内容、翻译配音、智能体外呼都在放量。

竞争格局同样在收紧,大模型厂商纷纷把原生语音能力装进自家产品,开源语音模型的榜单成绩也在快速逼近闭源。ElevenLabs的护城河在垂直深度:克隆质量、多语言覆盖、实时性能与开发者工具链的组合。这一代v4的更新方向表明,公司清楚自己的位置,继续在专业与实时两端拉开身位。对内容行业而言,需要同时做好两手准备,把工具用到正式生产里,也把防伪与授权机制提上日程。

验证与水印:声音需要的身份证

克隆门槛降到10秒,防伪机制的重要性随之抬升。行业当前的应对思路分三层。第一层是授权确认,克隆某个人的声音必须取得本人明确同意,ElevenLabs此前已要求录制口头同意声明并经系统校验。第二层是内容标识,在生成音频里嵌入机器可检测的水印,让合成语音可以被平台与监管工具识别。第三层是行为监测,对批量外呼、冒充特定身份的异常使用模式做拦截。

三层的组合仍不完美。水印能证明内容出自某个模型,却管不住不法分子改用没有防护的工具;授权声明能约束平台内使用,管不住用户下载音频后的二次流转。多起诈骗案例显示,受害者的判断被声音信任完全劫持,教育与流程防御,比如家庭暗号与回拨核实,短期内仍是普通人最有效的护身符。

监管侧的动作在提速。多个市场已就合成语音的标识义务出台规则,平台对冒充类内容的处置责任也在收紧。对ElevenLabs这类头部厂商来说,把验证与水印做成默认能力,既是合规要求,也是向企业与政府客户证明可托管的必要条件。

从工具到平台的路径

单看语音模型,ElevenLabs面对的竞争在加剧,大模型厂商陆续把原生语音能力装进自家产品,开源模型的榜单成绩也在逼近。公司的应对是把自己从模型供应商往平台方向推:语音智能体产品线承接电话客服与外呼场景,开发者工具链覆盖从克隆、合成到实时对话的完整链路,企业客户买到的是解决方案而不是权重文件。

这一代v4的功能布局延续了该逻辑。表演指令服务专业配音市场,Turbo服务实时智能体市场,多语言扩展服务出海内容市场,三条线分别对应三类付费意愿清晰的客户群。此前披露的财务数据也印证了结构:企业客户贡献过半收入,增长斜率陡峭。

对数字人与虚拟人行业而言,语音能力的持续升级是底层利好。数字分身的可信度由形象、声音与交互共同决定,声音这块短板每缩短一寸,实时交互数字人的落地场景就多一片。工具在变强,使用工具的规则也在同步成形,两件事的赛跑才刚刚开始。

素材来源:TechCrunch、36氪、量子位、机器之心 发布时间:2026-10-02