谷歌上线Gemini 3.8语音模型,30秒录音就能复刻同一个人的声音

首页 / AI资讯 / AI音乐

0:00
0:00
1x
定时

9月23日,谷歌发布两款新的语音合成模型Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,当天起在Gemini API与Google AI Studio上线。谷歌在公告里的表述是,要把语音生成从静态预设变成动态创作工作室。Flash TTS面向游戏、有声书与播客等创作场景,Flash-Lite TTS则是更低成本、面向高并发量的版本,主攻配音与语音智能体。两者都支持语音设计与声音复刻,也都带有内容溯源机制。这次发布的背景是,语音合成正从技术演示走向产品组件,配音、客服与内容本地化都在把语音生成纳入日常流程。

从预设音色到语音设计,创作者拿到了什么

最直观的变化是音色不再只能从列表里挑。用户可以用自然语言描述一个声音的角色、口音与特征,让模型从零设计出新音色,覆盖超过100种语言与方言。谷歌给出的示例包括来自墨尔本的高能电台主持人,以及一条日语龙。对于不想从零设计的用户,官方提供了超过2000种现成音色,其中包含墨西哥西班牙语、魁北克法语与苏格兰英语等地区变体,自定义音色可以保存下来跨项目复用。此外,一个名为语音重混的功能正在开发中,将允许调整音色、音高、语速与口音。

第二个变化是导演能力。两款模型都支持按行给出表演提示,可以在一份脚本里生成双人对白并保持两个音色互不混淆,也支持长达数小时的长音频生成,官方称在长时间生成中说话人的漂移很小。脚本里可以写入笑声、叹气以及类似嗯哼这样的短促插话,让停顿与反应落在指定位置。对有声书与播客制作者来说,这意味着过去需要在录音棚里反复调整的表演细节,现在可以在文本层直接指定。

第三个变化是模型分工。Flash TTS走表现力路线,Flash-Lite TTS走成本与吞吐路线,两者共用同一套接口,创作者可以在同一工作流里按段落切换。开发者平台方面,Agora、LiveKit、Pipecat与Vercel已经支持通过Gemini API接入;Figma、HeyGen、Wondercraft、Linguana、99.co与Ollang等公司则成为首批集成方,主要用在全球配音、地区口音本地化与对话式语音智能体上。

30秒复刻加同意验证,合规怎么落地

这次发布里最具争议也最关键的能力是声音复刻。Flash TTS可以用一段30秒的音频样本重建某个人的声音。谷歌为此设置了同意验证流程:用户必须提供由声音所有者本人录制的口头同意声明,系统会校验这段声明与参考说话人是否匹配,通过之后才会创建对应的声音。

内容溯源是另一道闸门。谷歌表示,其Gemini音频模型生成的每一段音频都会嵌入SynthID不可感知水印,用于在事后检测AI生成语音;复刻出来的声音还会附加内容凭证。这两套机制针对的是两类不同风险:SynthID解决这段音频是不是AI生成的,内容凭证解决这段声音的来源与授权链路是否可查。

地域限制同样值得注意。声音复刻功能在美国伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士与印度不可用,原因与当地关于声音权、生物特征数据与个人信息的法规差异有关。这说明语音合成产品的合规边界并不统一,厂商需要在不同司法辖区做功能裁剪。对企业客户而言,在部署前确认目标市场的可用性,比比较模型指标更重要。换句话说,同一段声音在部分地区可以合法复刻,在另一些地区则必须关闭入口,产品形态会因此随市场分裂。

一小时音频81美分,价格表里藏着时间表

定价方式按词元计算,文本输入与音频输出分开计费。生成一秒音频等于25个音频词元,一小时相当于9万个音频词元。按这个口径,Flash TTS一小时音频输出约0.81美元,Flash-Lite TTS约0.54美元,优惠持续到2026年12月31日。2027年1月1日起,两档价格分别涨到1.62美元与1.08美元。作为对照,它取代的3.1 Flash TTS预览版音频输出价格为每百万词元20美元,且没有优惠期。

价格表里透露的是一份产品时间表。优惠期到年底截止,说明谷歌希望在语音智能体与配音市场快速铺量,用低价换取集成量;明年起价格翻倍,则意味着它预期届时已经有足够多的产品依赖这套接口。这个节奏与当前语音赛道的竞争态势吻合,专业厂商如ElevenLabs已经在企业与创作者两端建立了口碑,Adobe也在8月把语音生成加进Firefly。

需要留意的是几个尚未明确的边界。免费层的数据会用于改进产品,付费层不会;音频输出的存储上限为每个项目200个音色,超出需要自行管理短期密钥;企业版通过Gemini Enterprise的接口开放时间标注为即将推出。对内容团队来说,一个更现实的问题是配音质量的一致性:当同一部作品的不同语言版本由同一个模型生成,跨语言的情绪与节奏是否能够对齐,将决定它能否替代传统配音流程。这一点目前还只有厂商演示,缺少第三方在不同语种上的系统评测。

素材来源:谷歌官方博客、The Next Web、AI and Tech News、AI Bacon 发布时间:2026-09-25