谷歌在9月24日宣布,把拟人化虚拟形象视频与其语音对话AI Gemini 3.8 Live结合的新功能Live Avatar,正式在企业级AI平台Gemini Enterprise上开放使用。该功能支持97种语言,能够实时生成与说话内容匹配的唇形和面部表情。谷歌云在公告中表示,Live Avatar即日起在Gemini Enterprise正式可用。该技术此前在谷歌云年度大会Next 2026上做过预览,如今已进入可部署于企业生产环境的阶段。
Live Avatar是一个把语音对话与视频生成整合在一起的多模态功能。屏幕上的形象会与说话内容同步唇形,并呈现自然的面部表情与对话反应。支持97种语言意味着系统需要在中途切换语言时也能调整唇形与表情,这对跨语种客服与出海业务是刚性需求。功能同时包含视觉识别能力,可以同时解读摄像头画面与屏幕共享内容,从而理解客户正在看什么,在客服与销售辅助场景中给出更贴合语境的回应。
从可用性设计看,这套功能还包含预留吞吐这类企业运营能力,即提前锁定处理容量,以适配金融服务、医疗与客服等受监管行业的稳定性要求。对已经部署语音客服的企业来说,这次变化的核心不是新增一种输出模态,而是把语音交互升级成有视觉存在的交互,把屏幕从展示信息的容器变成对话的一部分。
多语言支持背后是一组容易被忽略的工程约束。不同语种的音素集合差异很大,唇形与面部肌肉的对应关系并不通用,日语与阿拉伯语的口型节奏就与英语明显不同。系统要在语种切换的瞬间重新对齐时序,同时保证表情不过度夸张,这决定了它在多语种客服坐席上的可用性。
在技术实现上,系统采用语音到语音的方法,直接从音频输入生成音频,省去了传统三段链路中的若干转换环节。一个关键特性是能够在用户中途打断时保持上下文并继续对话,这是语音交互里最容易被忽略却最影响体验的环节:真人对话中打断是常态,而很多系统在被打断后会丢失前文。
另一个设计是在对话持续进行的同时,在后台异步调用工具与接口,从而把后台处理带来的中断降到最低。这一点决定了它能否真正承担业务动作,而不只是陪聊。语音交互的延迟预算极为紧张,从拾音、理解、生成音频到渲染同步视频,整条链路必须压在很短的窗口内;把工具调用挪到后台异步执行,等于把不确定耗时的环节从关键路径上摘出去。
语音到语音的难点在于两套时钟要对齐。音频生成是流式的,视频渲染也要按帧推进,两者任何一方抖动都会表现为唇形错位。行业内常见做法是先把音频缓冲几帧再开始渲染,代价是首字响应变慢。这类取舍在演示环境里看不出来,一旦进入坐席排班与质检流程,首字延迟和抖动率就会变成可量化的运营指标。
安全方面,谷歌的做法分两层。第一层是内容标识:所有生成的音频与视频都会嵌入不可感知的数字水印SynthID,确保AI生成内容在传播过程中仍可被识别与核验。第二层是权限控制:基于参考图创建自定义形象的能力,仅限通过白名单与验证流程的企业使用,这意味着企业不能随意把任意人脸做成可对话的虚拟形象。
服务端点目前限于美国与欧盟两个区域,这一限制既与合规环境有关,也反映部署成本。实时视频生成对算力与网络的要求远高于纯文本,区域化部署有助于控制时延与数据驻留。对打算引入这类能力的企业来说,水印与白名单的存在既是约束也是保障:它降低了形象被滥用的风险,同时也意味着自定义形象的门槛短期内不会放开。
水印与权限控制解决的是两类不同风险。水印针对的是生成内容外流之后的追溯问题,即便视频被二次剪辑或转码,标识信息仍应可被检测;白名单针对的则是形象来源的合法性,防止未经授权的人脸被做成可对话角色。两道锁分别对应事后追责与事前授权,缺一不可。
早期采用者已经给出具体场景。Cox Automotive把它用在汽车销售网站Autotrader上,部署了一个对话式AI形象,用户用自然语言描述偏好,形象就推荐库存车辆。该公司的首席产品官表示,购车者越来越希望用自己的话描述需求,而不是在筛选器和菜单里翻找。印度的Equal AI每天通过AI处理超过100万通实时通话,覆盖九种印度语言,其首席执行官称系统在打断处理、多语言对话与工具调用稳定性上都有改善。Salesforce则计划把其智能体平台Agentforce与Gemini 3.8 Live结合,重建从初次咨询到问题解决的客户体验。
竞争压力将直接传导到数字人赛道。过去企业级虚拟形象多由专门厂商提供,需要单独采购与集成;当这类能力作为既有云平台的一项功能提供,企业的评估维度就从效果好不好转向要不要再多接一个供应商。与此同时,谷歌在同一周还发布了Gemini 3.8 Live、Live Avatar Extended Thinking以及Gemini 3.8 Flash TTS两款语音合成模型,语音与视频相关的产品密度明显提升。对第三方数字人厂商来说,差异化的空间会收窄到更垂直的场景、更深的行业集成与更灵活的形象定制权限上。