在刚刚落幕的2026世界人工智能大会上,60台人形机器人以志愿者身份在展馆里跑导览、答问询,而在去年它们还只是在展台上奔跑和跳舞。与之并行的另一条战线上,AI数字人的变化同样深刻。虎牙发布的VAM 1.0实时多模态数字人,用一张照片就能驱动一个7×24小时实时直播互动的数字人。科大讯飞的AI主播小百惠今年已能与真人主持同台对话。商汤展台上的数字人产品也集体换代。这些变化指向一个共同的趋势:AI数字人的竞争正在从拼模型能力变成拼工程化落地能力。腾讯副总裁林松涛在大会上说得直白,当前模型能力的差距在收窄,但工程化的差距在拉开。真实场景是AI价值的第一现场,终端是AI普及的最后一公里。
商汤此次在WAIC上展出的数字人产品体现了另一条技术路线的进化方向。与虎牙从直播场景出发不同,商汤的数字人产品线源于其在计算机视觉领域十余年的积累。商汤CEO徐立在WAIC上提出了一个关键观点:未来的核心计费维度应当是任务完成的价格,AI的衡量单位要从Token转向Task,从卖算力转向卖结果。这个观点揭示了数字人产业正在经历的深层变革。数字人不仅要能说话,还要能完成任务。商汤的SenseNova U1 Pro实现了原生多模态的生成能力,数字人不仅能够说话和做表情,还能根据上下文动态调整语气和肢体语言。科大讯飞则从语音技术出发构建了数字人的差异化优势。其AI主播小百惠从新闻播报场景里生长出来,今年已经能实现与真人主持的同台对话。在媒体播报场景中数字人需要处理突发新闻、实时数据和互动问答,这对语音合成和自然语言理解的能力提出了极高的要求。商汤和科大讯飞从不同的技术原点出发正在向同一个目标汇合:让数字人在真实场景中创造商业价值。
虎牙VAM 1.0是本届WAIC上最受关注的数字人产品之一。它的核心能力是只用一张照片就能驱动一个数字人,实现7×24小时实时直播互动,支持唱歌跳舞、游戏陪玩和赛事解说等多种场景。VAM 1.0之所以能做到这一点,背后是虎牙团队的三段式训练架构设计。第一阶段是让它稳。团队故意往训练数据里喂入模糊、抖动的劣化画面,让模型学会在恶劣输入条件下仍然稳定输出。第二阶段是让它真。使用偏好优化算法在唇形、表情、动作之间做精细平衡,让数字人的每一个微表情都更加自然。第三阶段是让它快。把生成步骤从20步压缩到4步,同时引入自蒸馏机制,让模型自己批改自己的输出以减少误差。VAM 1.0的技术根植于虎牙在直播领域长达十几年的积累。弹幕、连麦、打赏、实时互动这些直播间要素构成了一个独特的高频交互场景。正是这个场景倒逼出了相应的技术:数字人需要实时理解弹幕并根据内容做出反应,需要能够应付间歇性的打赏特效和连麦请求,需要长时间稳定运行而不出现画质劣化或延迟升高。这种在场景里长出来的技术,比单纯从实验室里打磨出来的模型更具工程价值和商业可行性。
另一个值得关注的产品是百度一镜。它并不是一个简单的数字人生成工具,而是一套由编剧、导演、剪辑三个AI智能体和80多个技能组件构成的数字人视频创作流水线。用户输入一个简单的内容主题,编剧智能体自动规划文案结构,导演智能体安排镜头和场景,剪辑智能体负责最终的合成和输出。这种多智能体协同的工作模式,把一条播客、带货视频的生产流程完全自动化了。企业用户只需要确认内容和风格方向,不需要具备任何视频制作技能,就能在数分钟内获得一条由数字人出镜的专业视频。科大讯飞的AI主播小百惠从媒体播报场景里生长出来。最初的设计目标是辅助新闻播报,生成标准化的口播内容。但经过持续的迭代升级,小百惠今年已经能够与真人主持同台对话,具备了实时互动和即兴对答的能力。这表明数字人正在从单向播报进化到双向交互。商汤的SenseNova U1 Pro则展示了另一条技术路径,它实现了原生多模态的生成能力,数字人不仅能够说话和做表情,还能根据上下文动态调整自己的语气、语调和肢体语言。
这届WAIC上传递出一个清晰的信号:AI数字人产业正在从模型驱动阶段切换到场景驱动阶段。2025年之前,行业关注的核心问题是如何让数字人动起来、看起来像真人。2026年,问题已经变成了数字人能在什么场景下真正创造商业价值。这一转变的背后有两个驱动力。第一个是技术红利期的收窄。过去两年中,AI数字人的底层技术在语音合成、面部动画、肢体驱动等关键环节上取得了长足的进步,各个平台之间的技术差距正在缩小。当一个行业的核心技术变得相对成熟和可获取时,竞争的重点自然就从技术本身转向了如何更好地应用技术。第二个驱动力是商业验证的需求。资本和市场已经开始要求数字人产品交出实际落地的成绩单,而不再满足于技术演示。从WAIC现场展示的案例来看,数字人在电商直播、文旅导览、教育培训、金融客服等场景中的落地正在加速。京东的言犀数字人背靠多年电商供应链,已经在电商直播中实现规模化运营。虎牙VAM 1.0瞄准的是直播电商和游戏陪玩两个垂直场景。科大讯飞的小百惠已经在多个电视台的新闻播报和活动现场中投入使用。伴随着场景从浅到深的渗透,数字人正在完成从模特到岗位的角色转变。