新型脑机接口首次同步解码语言与动作,数字人有了神经驱动新方式

首页 / AI资讯 / 数字人

0:00
0:00
1x
定时

美国国立卫生研究院9月中旬宣布,加州大学旧金山分校的研究团队开发出一款新型脑机接口,能够同时解码瘫痪患者想要表达的语言与想要完成的上肢动作,相关成果发表于《自然·神经科学》。在爱德华·张带领下,团队为3名因肌萎缩侧索硬化或脑干中风而瘫痪的患者植入薄型电极阵列,其中2名参与者的脑活动可以驱动一个同步说话和做动作的全身虚拟化身。这项进展之所以被数字人行业关注,是因为它提供了一种不依赖摄像头与语音输入的驱动方式。

薄型电极阵列,三名患者与两例可用的脑信号

试验的硬件基础是覆盖在脑皮层表面的薄型电极阵列,它记录的是神经元群体的放电模式,而不是单根神经元的信号。三名参与者均因运动神经元疾病或脑干损伤失去自主说话与肢体活动能力,但负责语言规划与上肢运动意图的皮层区域仍然活跃,这为解码提供了生理前提。最终三名参与者中有两名的大脑信号能够稳定支撑同时进行的语言与动作输出。

从临床研究的角度看,样本量小意味着结论需要谨慎对待,个体差异、电极长期稳定性与信号衰减都是后续必须回答的问题。但这项研究验证的是一件事:语言意图与肢体运动意图可以在同一套解码框架下被并行读取。过去多数脑机接口研究把语言与动作分开处理,因为两者的时间尺度与编码方式差异很大,能同时解码本身就是技术路线上的一个新台阶。

研究设计上还有一个细节值得注意:电极阵列覆盖的是皮层表面,属于相对低侵入的方案,而不是把电极插入皮层内部。这意味着信号的空间分辨率有限,必须依靠解码算法从群体放电模式中提取意图。对临床推广而言,这一取舍很关键,它直接关系到手术风险、电极寿命与患者接受度,也解释了为什么这类研究往往在算法侧投入远多于硬件侧。

语言与上肢动作同解,从键盘输入到全身虚拟化身

这项研究的输出端不是一段文字,而是一个会说话同时会做动作的虚拟形象。参与者想象说话时,系统解码出语音内容并驱动化身的口型与表情;参与者想象抬手或做手势时,系统同步解码上肢运动意图,让化身做出相应动作。两种意图在同一时间窗内被分别提取并合成,形成连贯的表达,这对需要同时传达语气与肢体语言的沟通场景尤为关键。

对数字人产业来说,这套方案的意义在于它把驱动信号从外部采集推进到了内部意图。目前主流的数字人驱动依赖摄像头捕捉表情、麦克风采集语音或动捕设备记录骨骼运动,本质上都是对表演的二次采集。而神经解码绕过了表演环节,直接把使用者的意图映射到虚拟形象上,对于失去表达能力的人群,这是从无法沟通到可以表达的变化,而不是效率层面的改善。

需要说明的是,这类系统的使用节奏与人们想象中不同。参与者并不是每秒都在输出,而是在明确的尝试意图出现时触发解码,系统需要在背景神经活动中区分想说话与只是休息的状态。这个开关机制决定误触发的频率,也决定使用者在日常沟通中是否感到自在。对依赖这类系统生活的人来说,误触发带来的尴尬往往比延迟更影响使用意愿。

从摄像头到神经元,数字人驱动方式的第三条路

把这条路径放进数字人的技术谱系里,可以看清它的位置。第一条路是视觉驱动,靠摄像头与算法重建面部与身体动作,成本低、部署快,但受光照、遮挡与表演能力限制。第二条路是语音驱动,用音频生成口型与表情,适合口播场景,但动作维度有限。第三条路是神经信号驱动,信息最直接,带宽受电极通道数限制,侵入性也最高。

三条路目前服务的场景几乎没有重叠。视觉与语音驱动面向内容生产,追求低成本与高并发;神经驱动面向医疗康复与重度残障沟通,追求准确与可靠。但随着非侵入式传感与解码算法的进步,第三条路的边界可能向外扩,例如在极端噪声环境或需要双手同时操作的工作场景中,用神经信号替代语音指令。数字人的驱动方式之争,最终会落在场景适配而不是技术优劣上。

从产业角度看,神经驱动短期内不会成为数字人的主流方案,但它会推动另外两件事。一是把生物信号纳入多模态输入的统一框架,让数字人系统在设计时就考虑如何接收非视听类信号;二是把评估标准从像不像人转向意图传达是否准确,这对面向无障碍与远程协作的数字人产品尤其重要,也会改变这类产品的验收方式。

信号即身份,神经数据带来的合规与伦理空白

当驱动信号变成脑电数据,数字人的治理问题也换了形态。语音与视频属于生物特征,已经在多个法域受到个人信息保护规则的约束;而神经信号记录的是认知与情绪状态,敏感程度更高,且难以像密码那样重置。一旦这类数据被用于训练模型或用于推断使用者未表达的想法,现有的同意机制与删除权都很难直接套用。

另一个悬而未决的问题是身份归属。如果虚拟化身的动作与语气来自对某人神经信号的解码,那么这个化身在人格权层面属于谁,在商业化使用时应如何授权,目前没有成熟答案。临床研究的伦理审查通常覆盖实验范围,却不覆盖技术走出实验室之后的用途。这项研究打开的是一扇门,门后的规则建设才刚刚开始,而数字人行业如果等到应用落地再补规则,代价会比现在高得多。

对数字人行业来说,这项研究更像一次提前到来的压力测试。当驱动信号从表演采集变成生理数据,产品经理需要回答的问题从画得像不像,变成数据存在哪、存多久、谁能访问、模型是否会从中学习。这些问题的答案不会来自算法进步,而来自产品设计与合规前置,越早把边界写进设计文档,后期返工的成本就越低。

素材来源:IT之家、美国国立卫生研究院、Nature Neuroscience、AGI Hunt 发布时间:2026-09-17