Tavus发布Griffin实时交互模型:54人盲测近一半把AI当成了真人

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

10月1日,旧金山初创公司Tavus发布实时视频交互模型Griffin,并给出一组足够震撼的数据:54名参与者与精简版模型进行一分钟视频通话,他们事先以为对面是真人,结束后26人认为交流对象是人类,占比48%。Tavus称这是首个通过视频图灵测试的AI视频交互系统,而其上一代产品在同样测试中的通过率只有2.4%。从不到百分之三到近一半,数字人拟真度的跨越发生在了短短一个版本周期里。

盲测数据的分量有多重

视频图灵测试的核心逻辑很简单:让受试者与AI对话,看能否分辨对面是人还是机器。过去这类测试里AI的通过率长期停留在个位数,破绽往往出在反应时机、表情节奏这些人类毫不费力、机器步步惊心的细节上。48%意味着在随机状态下接近抛硬币,普通人已经无法凭直觉判断屏幕对面是不是人。

值得强调的是测试条件的严格性:受试者事先不知情,通话持续一分钟,评价基于真实的互动体验而非静态画面的观感。数字人行业过去习惯用清晰度、帧率这类参数说话,而这次直接用人类判断力做标尺,指向的是交互体验的完整闭环。参数再漂亮,用户聊三句就出戏,商业价值就要打折扣;反之,能骗过人类直觉的系统,才具备承载信任型场景的资格。

全双工架构:随时插上话的技术底座

Griffin的拟真感来自全双工的视频到视频架构,这是与传统数字人最大的区别。传统方案的流程是串行的:等对方说完、识别内容、生成回复、再合成视频,每个环节都有等待,表情动作只能硬凑。全双工则让模型以亚秒级间隔持续感知对方的音频与画面,自主决定什么时候接话、什么时候点头附和、什么时候微笑回应,说与听在同一时间轴上进行。

具体到生成环节,视听生成引擎以320毫秒为一块连续产出720p视频,音频到视频的延迟平均0.43秒,是已公开方法中最快者的一半。在第三方全双工视听基准上,Griffin的生成得分3.83,已十分接近人类参考值3.92,感知得分3.73全面领先。此外,它能从约10秒音频克隆说话人声线,并根据对话上下文实时调整语调、笑声、表情与手势。这些数字翻译成体验,就是对面那个人会在你说话时自然地嗯一声,会因为你讲笑话而先笑出声。

最像人,却先踩了刹车

反直觉的是,Tavus并没有急着把最强版本推向市场。公司明确表示,正因为它太像人,暂时不向普通客户开放,先完善安全评估与披露功能。这个决定背后的考量并不复杂:当48%的人无法分辨真假,技术就跨过了从工具问题到社会问题的门槛。视频通话里的身份冒用、深度伪造诈骗、未经同意的形象合成,每一项都因拟真度跃升而风险倍增。

行业里对这类能力的监管框架也在收紧,国内外都有规则要求AI生成内容显著标识。Tavus选择先做披露与安全,等于承认了一个行业共识:拟真度的商业价值建立在可控边界之上,一旦发生标志性滥用事件,整个赛道的信任成本会被整体抬高。先踩刹车看似慢,实则是把监管风险前置消化。

数字人行业的下一站

Griffin的发布给行业划出了新基线:实时全双工、亚秒级响应、盲测级拟真,这三项从实验室指标变成了可对标的工程标准。对同行来说,竞争焦点会从像不像升级为真不真,表情的因果逻辑、对话的时机感这些难以量化的维度成为新的分水岭。对应用方来说,客服、教育、陪伴、面试辅导等高交互场景的可行性被重新评估,数字人从预录播报员向对话参与者的转型有了技术前提。

真正的考验在发布之后:大规模使用中的滥用如何拦截、拟真数字人的身份披露标准由谁制定、用户对真假边界的知情权如何保障。视频图灵测试通过的那一刻,技术问题就让位给了治理问题。Tavus用一次发布同时给出了答案的上半句,下半句,要整个行业一起写。

克隆声音与形象授权的边界

Griffin能从约十秒音频克隆声线,这个能力的商用边界必须先于产品落地理清。声音克隆的授权链路远比想象复杂:录制者是否有权代表被克隆者授权、克隆形象能否用于商业代言、授权范围是否覆盖特定语言与场景,每一个含糊之处都是潜在纠纷。国内司法实践已有先例,对录音制品的授权不等于对声音AI化的授权,这一裁判思路值得所有从业者对照自查,把授权文本的颗粒度做细。

Tavus把安全评估与披露功能放在开放之前,某种程度上是在为行业试探规则。拟真度越高的系统,越需要清晰的授权协议、使用留痕与内容标识,这三件套会从加分项变成准入门槛,越早建立越主动。

从演示到产品的距离

从盲测惊艳到商业落地,中间还有几道坎。实时生成720p视频的算力成本决定了单路通话的服务价格,规模化部署的账能不能算平要看企业客户的付费意愿;企业接口的稳定性、与现有会议与客服系统的集成深度、多语言场景的表现,都是采购方会逐项过筛的硬指标,任何一项短板都可能让 demo 里的惊艳变成验收时的扣分项。

参考行业节奏,拟真交互数字人的第一批规模化场景大概率出现在高客单价的服务环节:高端咨询、教育辅导、定制客服,这些场景对拟真度的支付意愿最强,对成本的敏感度最低。当技术与成本曲线继续下探,才是大众场景铺开的时机。

素材来源:TechCrunch中文网、机器之心、量子位、新智元 发布时间:2026-10-04