9月28日,波士顿语音智能公司Modulate宣布完成2500万美元新一轮融资,由Future Ventures领投,Hyperplane与Lakestar参与。据投资数据机构统计,这家公司此前已累计融资约4100万美元,上一轮估值约1.7亿美元,本轮完成后官方口径的累计融资额达到6000万美元。Modulate成立于2017年,两位创始人Mike Pappas与Carter Huffman在麻省理工学院读物理时相识,公司最早为游戏提供声音调制技术,随后转向语音聊天内容审核,其ToxMod系统自2023年起被用于大型射击游戏的语音聊天管理。
当前多数语音分析工具的做法,是先把通话转成文字,再在文本上做理解。Modulate认为这条路丢掉了太多信息。公司首席执行官在受访时表示,行业里做转写的人很多,但很少有产品能拿到一段对话的完整细节与理解,而这恰恰是人与人交流时最重要的部分。一句带着讽刺意味的话、一段发抖的声音、一个由机器合成的来电,在被压缩成文字之后,看起来可能和真诚的表达没有区别。
语音正在成为AI的主要交互界面,这个判断是这轮融资叙事的基础。当越来越多的客户服务、身份核验与业务沟通经由语音完成,仅凭文字记录就无法支撑风险判断。语气里的犹豫、停顿的长短、被打断的次数,这些信号在客服质检与反欺诈场景里往往比说了什么更关键。Modulate的产品定位,就是在既有的语音技术栈旁边再加一层专门处理原始音频的分析能力。反过来说,如果只保留文字记录,事后复核时就很难还原当时的语气与节奏,而这恰恰是判断一通电话是否出了问题的关键线索。这也是为什么一些质检团队开始把音频本身作为一级数据保存,而不是只留一份转写稿。
Velma的核心设计不走单一大模型路线,而是采用公司称为集成听觉模型的结构:为每项任务挑选并组合一百多个更小的专用音频模型,分成两大类。第一类是信号提取模型,用来理解声音里的情绪、语调、语言特征,以及判断这段声音是否由机器生成;第二类是分析与检测模型,用来判断说话人的意图,例如对方想表达什么、是否在违反规则、是否在实施诈骗。公司称,由于使用的是较小的模型,不需要专用硬件与大量算力,也更容易把新训练出来的能力加进模型池,再由调度层按需调用。
性能方面需要区分两类证据。公开可查的部分是,Modulate的转写模型在今年7月登上某开源语音识别榜单的88个条目之首,其深伪检测模型自3月起在该平台的语音深伪竞技场中排名第一,在该公开数据集上的等错误率约为1.1%,准确率约98.9%。属于公司自述的部分则包括:Velma在识别真实问题上的准确率约为通用大语言模型的两倍,误报率低至其七分之一,集成结构最高可节省约千倍算力。这些对比由公司自己给出,尚未经过独立验证。对采购方而言,公开榜单能说明基础能力,但真正决定工具能否留在系统里的,是它在本方通话录音上的误报率。
从公开信息看,Modulate的客户场景集中在三类。一是深伪防范,医疗机构用其模型拦截冒充医护人员的合成语音来电,呼叫中心用它提示可能的诈骗。二是智能体质检,随着越来越多企业把客服交给AI语音智能体,企业需要知道一通电话为什么成功或失败,而客户往往会出于礼貌保持平静,语气听起来正常,实际已经很不满意,这类信号只有从音频里才能读出来。三是合规监控,在受监管行业里核查语音智能体是否遵守了规则。
公司还提到,其技术被用于监测通过语音电话实施的网络攻击。定价方面,目前公开的只有批量转写一项,价格为每小时三美分,真正对外主推的深伪检测与智能体质检这两层能力尚未公布价格。这给预算规划带来不便,采购方无法从公开数字推算成本。另一个需要纳入风险评估的因素是团队规模,公司目前约40到45人,计划再招十人左右,对于把深伪筛查放在实时通话链路上的机构来说,供应商的支持能力本身也是风险的一部分。
这轮融资的背景,是声音克隆的门槛已经低到普通人也能使用。几秒钟的样本就足以复刻一个人的音色,诈骗、冒充与虚假宣传随之增多,多起涉及AI合成声音的纠纷已经进入司法程序。在这种环境下,能判断一段声音是否来自真人的检测能力,从可选项变成了必需项。Modulate把自身定位在语音技术栈之外的一层独立分析能力,正是看准了这个位置。
公司表示正在推进本地部署与设备端部署能力,以满足对数据外传敏感的客户。这一点对企业客户格外重要,因为把通话音频送出内网通常需要经过漫长的隐私评审。对整个数字人行业来说,语音合成与语音检测是一对相互拉扯的能力:合成越逼真,检测的需求越强;检测越有效,合成产品就越需要在合规标识与授权使用上做足功课。当这两条线同时推进,声音授权与生成标识很可能会像图像水印一样,成为数字人产品的标准配置。