Synthesia开放实时数字人API,每分钟0.12美元让数字人开口对话

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

数字人过去几年解决的是"生成"问题:输入一段文字,输出一个口型准确、表情自然的说话视频。但这类产品有个共同的天花板,它只能单向输出。9月16日,英国数字人平台Synthesia推出Interactive Avatar API,把产品能力从"会说话"推进到"会听、会回应"。开发者可以把实时对话的数字人直接嵌进自己的产品、网站或内部工具里,数字人作为视频参与者加入房间,与用户进行双向交流。

数字人第一次会"听"

能力的差别在交互方向上。此前的数字人视频是离线生成的成品,用户的参与方式仅限于观看;Interactive Avatar则运行在实时会话里,能够持续接收用户语音、生成回应并同步口型。Synthesia的产品负责人把这一步称为从"更擅长说话"到"能听并回应"的跨越,并指出多数数字人演示仍停留在单向播报阶段。对培训、客服、销售与前台接待这类场景来说,单向播报与双向对话之间隔着的正是实用性的门槛。

实时视频的工程难度远高于离线生成。语音、渲染、口型同步、轮流发言、打断处理、延迟与基础设施要同时成立,其中任何一环拖慢,体验就会退化成"电话树式的等待"。从产品角度看,会听与会说之间的差别,决定了数字人能不能被放进需要来回确认的业务流程里,例如销售报价、入职答疑或设备报修这类多轮沟通场景。Synthesia方面坦言,把这几件事做到一起,与离线生成视频是完全不同的工程问题,团队后续还会持续改进表现力、倾听行为、打断处理与延迟。

你带LLM,我出脸:分工式架构

这套API的架构设计得相当克制。开发者需要自带大模型、语音识别、知识库与业务逻辑,Synthesia只提供数字人这一层:倾听、说话、口型同步与视觉呈现。集成方式是给一个已有的LiveKit语音智能体挂上一个AvatarSession组件,两行代码即可完成,数字人随后以视频参与者身份加入LiveKit房间。插件会接管智能体的音频输出,把语音转发给托管的数字人工作进程,由后者渲染出唇形同步的视频与音频再发布回房间。整个过程不需要GPU,也不需要在智能体进程里跑任何视频代码,渲染全部托管。

这个分工的重要性在于,客户不必为了加一张脸而更换自己的AI技术栈。企业已经在用的大模型、智能体、知识库与工作流都可以保留,只在需要面对面交流的环节补上数字人层。接入路径已经包含官方技能包,Claude Code、Cursor与Copilot Workspace这类编程智能体可以自动搭建集成脚手架。目标场景被官方列为AI销售代表、客服智能体、带评分规则的陪练培训与线下自助终端,其中陪练培训可以通过Webhook把评分结果回传。

每分钟0.12美元,把试错成本压下来

定价采用按量计费,每分钟0.12美元,无需承诺与最低消费,每个用户可先获得500分钟免费额度用于试验。这个价格结构对采购决策的影响不小。企业评估数字人项目时,最大的不确定性往往是使用量与效果之间的匹配关系:不确定一个月会用到多少分钟,也不确定用户是否真的愿意跟数字人对话。按分钟计费把固定投入变成了可变成本,先小范围试跑再决定是否规模化,比一次性采购平台许可更符合真实的验证流程。此外,按分钟计费也让数字人项目更容易和其他AI能力的成本放在一起比较,采购方可以按单位交互成本来判断值不值得铺开。

目前这套能力有明确的边界。官方文档显示,插件当前仅支持Python版LiveKit Agents,也就是说非Python技术栈的团队需要自行调用API并管理会话令牌,灵活性更高但工作量更大。此外还有一处容易被忽略的实现细节:数字人必须在会话启动前挂载,启动后再挂会失效;挂载之后也不能重新指定音频输出,否则口型同步会中断。这类约束在真实集成中很容易踩坑,官方把它们写进文档,说明实时链路的时序要求相当严格。

数字人赛道的重心从生成转向交互

把这次发布放到行业脉络里,能看到一条清晰的重心迁移。数字人最初的价值主张是降低视频制作成本,让企业不用请演员、租影棚就能批量产出多语言培训内容,Synthesia自己就是靠这条路径成长起来的。当生成能力变成基础能力之后,竞争点转向了两处:一是表现力的细腻程度,二是能否进入实时交互链路。9月10日Synthesia发布的Express-3模型把生成速度提升一倍、口型更精准、动作更自然,解决的正是前一个问题;Interactive Avatar API处理的是后一个问题。

这条路线也有它需要证明的地方。实时对话数字人的价值最终取决于用户是否愿意对着一个虚拟形象说话,以及这种交互是否比纯语音或纯文字更有说服力。行业里常见的判断是,在需要建立信任、需要观察反应的场景中,一张脸确实能提高完成率;而在效率优先的查询类场景里,语音与文字反而更快。对国内做数字人的团队来说,这次发布给出的参考价值不在技术细节,而在产品结构:把智能层与形象层解耦,让客户保留自己的模型与业务逻辑,同时把计费方式改造成按分钟的可变成本。这两件事降低了客户的决策门槛,也把竞争从"谁的模型更强"拉回到"谁的体验更稳"。

素材来源:Synthesia、TechCrunch、AGI Hunt、LinkedIn 发布时间:2026-09-19