9月14日,总部位于西雅图的研究实验室Nuance Labs宣布完成5000万美元A轮融资。本轮由老股东Lightspeed Venture Partners领投,老股东Accel与South Park Commons继续参与,英伟达与Define Ventures作为新投资方入场。加上2025年9月的一笔1000万美元种子轮,公司已公布融资约6000万美元。资金将用于模型研发、扩充研究团队,并支持今年晚些时候面向公众开放的研究预览,官网目前开放了早期演示的等候名单。
这家公司的目标不是做某一个行业的应用,而是重做数字人的底层架构。三位创始人方畅、Edward Zhang与Karren Yang都曾是苹果的研究人员,其中两位参与过Vision Pro的数字人系统。他们判断,数字人之所以一直不自然,问题不在像素质量,而在架构:机器从来没有真正理解人是怎样交流的。
当前绝大多数数字人系统由零件拼装而成:语音识别把音频转成文字,大语言模型决定说什么,语音模型把答案读出来,动画系统再驱动一张脸去匹配。问题出在每一次交接上。语调、迟疑、目光、手势这些信息可能在转成文字的那一步就被丢弃,语言模型拿到的只是残缺的意图;而面部动画要等整条链路产出结果才开始工作,于是出现人在说话时数字人呆坐不动、或者抢话打断的场面。
延迟与卡顿进一步破坏了现场感。这条串行管线每一段都要花时间,累积起来就超出自然对话能容忍的范围。Nuance Labs的描述是,数字人从来没自然过,因为我们一直在扭曲自己的表达方式去迁就机器,而不是让机器来适应我们。他们给出的替代方案是一个全双工视听模型:音频与视频的感知持续流入,视听响应同时流出,理解与表达在同一个模型里完成,而不是先听完再回答。这样一来,模型可以在对方还没说完时就通过语言与非语言线索表明自己在跟,这正是真人对话里最基础也最难模仿的部分。
从工程角度衡量,这条路线要跨过几道门槛。公司把约500毫秒描述为自然对话延迟的硬性底线,也就是说从用户开口到系统给出可感知的回应,必须在半秒量级之内完成,否则交互就会显得迟滞。这个目标与全双工架构天然契合,因为响应不再需要等待完整转写结果,但同时意味着模型必须持续处理视频与音频流,单位时间内的推理开销明显上升。
需要如实指出的是,公司尚未公布生产环境下的延迟基准来证明这一设计目标已经达成,也没有公开与成熟模块化语音方案在端到端延迟、打断处理、用户偏好与推理成本上的对比测试。集成式模型省去了串行交接,可以把视听上下文保留在同一个学习系统里;模块化方案则可以为语音识别、推理与合成分别选用专门模型,独立扩缩容,并在不重训整个产品的前提下替换某一层。两种路线的取舍最终会体现在每分钟的计算成本上。英伟达的参与恰好呼应这一权衡:更好的实时交互意味着更苛刻的推理负载,但投资本身并不证明这条负载更便宜。
创始团队的背景解释了为什么他们会选择这条最难的路。方畅拥有麻省理工学院机器人学与机器学习博士学位,曾参与苹果ARKit深度、Vision Pro深度与iPhone影像相关项目,在苹果期间与Edward Zhang共同参与Vision Pro的数字人系统开发;Edward Zhang在华盛顿大学完成计算机图形学博士;首席科学家Karren Yang同样拥有麻省理工学院博士学位,研究音视频合成,此前在苹果西雅图研究团队工作。投资人Yaser Sheikh担任顾问。
他们在苹果看到的现实是:忠实地重建一个人用于远程在场,本身就是难题;至于跟上实时对话里语言与非语言线索的交错,更是远远没有解决。这段经历促使他们不再逐段解决,而是从音频与视频信号出发,把理解与生成人类对话和表达这件事当作一个整体问题来做。公司目前列出20多名研究人员、工程师与运营人员,较种子轮时四人规模明显扩张,招聘方向覆盖建模、数据、评测、推理与实时服务,指向的是自研推理栈而非单纯调用外部接口。
投资方结构透露了应用方向的线索。英伟达通过其投资部门参与,对应的是持续视听推理这类高负载场景的算力需求;Define Ventures的入场更耐人寻味,这家机构专注数字健康投资,其参与可以读作一个信号:能够读取细微表情与语调的技术,在心理咨询、健康教练这类高度依赖人际信任的场景里可能找到落点。公司列出的可能应用还包括销售与客服、教练、职业培训与教育。
这些场景其实分成两门生意。一门是实时生成情绪:让数字人的面部表情、语音语调与肢体语言协调起来,给出恰当的情绪回应,比如一个会停顿思考、会给出鼓励表情的AI陪练。另一门是实时读取情绪:注意到演讲者信心动摇的那一瞬间,或者在一场面试中不仅听清候选人说了什么,还能捕捉他是怎么说的。两门生意共用同一个基础模型,但商业路径差别很大,前者是交互层,后者是评估与洞察层。公司把自己定位为可供其他产品构建的交互层,这条定位能否成立,取决于今年晚些时候那次公开预览:一个模型能不能既足够快地响应实时对话,又保住身份、表情与连贯表达,答案要在真实使用里才看得出来。