交流从来不只是说出一句话。点头表示认同、耸肩传达无奈、手势用来强调或指向——这些非语言线索同样构成对话的一部分。美国加州大学旧金山分校(UCSF)研究人员展示了一种脑机接口(BCI):它能从同一套植入系统中,同时读取使用者想说的话和想做的上半身动作。
研究涉及 3 名发声通路和肢体瘫痪的参与者。他们尝试说话、做手势;系统记录相应脑活动,再借助机器学习,在接近实时的速度下让个性化虚拟化身说话并活动。
1
7
253 个电极如何读取两类沟通意图
该系统采用一块高密度皮层脑电图(ECoG)电极阵列,共有 253 个电极,放置在大脑表面的感觉运动皮层上。这个范围较广的脑区与言语动作,以及上半身运动有关。
1
7
即使参与者无法像平常一样完成发声或动作,他们在尝试说话、尝试做动作时,仍会产生可被记录的相关神经信号。机器学习模型随后把这些信号转化为屏幕文字和虚拟化身动作,因此,言语输出和动作输出不再必须分开控制。
1
4
研究观察到与多类运动有关的信号,包括和言语相关的口部、面部运动,以及点头、耸肩、振臂等上半身手势。在其中两名参与者中,团队实现了言语与手势的并行解码,用于共同控制虚拟化身。
7
为什么不能把“说话”和“手势”当成一个指令
言语和手势虽是彼此配合的沟通方式,但研究团队没有把它们视作同一种笼统的运动命令,而是针对预期的语言输出与动作输出采用不同的解码方法。
这一点很关键:研究报告指出,同时进行言语和手势时记录到的神经模式,并不只是“单独说话信号”与“单独做手势信号”的简单相加。针对组合式沟通任务进行训练后,系统才可以协调输出——例如,虚拟化身在说出一句话的同时,做出对应的上半身动作。现有报道足以支持这项同步、多模态演示,但不足以让外界独立量化这种非简单叠加效应的大小,或完整比较各种任务中的解码表现。
1
4
7
不只把文字显示出来,而是补回表达力
许多辅助沟通系统依靠逐个选择字母、单词或图标来表达意思。这类系统很有价值,但逐项选择往往让对话变得缓慢且费力。
UCSF 此前的言语神经假体研究直观说明了速度差距:一名参与者原有的沟通设备约为每分钟 14 个词,而实验系统的文本解码速度接近每分钟 80 个词。
28
新系统瞄准的还有另一层缺口:纯文本无法承载对话中的全部社会性含义。手势可以与语言同时表示赞同、强调、问候或指示方向。因此,会说话也会动的虚拟化身,目标并非只是让文字更快出现在屏幕上,而是让表达更接近自然交流。
1
34
参与者与实验范围:目前能确认什么
研究人员从3 名发声通路和肢体瘫痪的参与者身上记录脑活动,测试了尝试言语、上半身运动,以及其中两人的言语—手势并行解码。
7
所提供资料并未给出每位参与者瘫痪原因的可靠逐人说明,也没有完整披露实验任务流程。相关报道谈及的更广泛人群可能包括卒中和肌萎缩侧索硬化症(ALS)等情况,但在缺少完整临床资料时,不能据此把某一种诊断归给任一具体参与者。
36
仍是概念验证,距离日常使用尚有距离
这套 BCI 目前仍属于研究性系统。已展示的装置需要通过导线,把植入皮层的电极网格连接至外部记录与计算设备;这会限制使用者独立、日常地使用它。
团队提出的研发方向是全植入式无线版本,以去除穿过皮肤的连接线。不过,现有证据没有给出明确时间表、制造商信息或监管批准状态,因此现在还不能把它视为可获得的医疗产品。
与 UCSF 2023 年“言语化身”研究的关系
这项新工作承接了 UCSF 在 2023 年主导发表的《自然》研究。此前,一名严重瘫痪并患有失语症的参与者通过 253 通道高密度 ECoG 阵列,将拟说出的句子解码为文字、合成语音和面部虚拟化身动画。
33
2023 年的系统侧重言语及面部输出;新研究则沿用“皮层表面记录+人工智能解码”的总体路线,把能力延伸到可与言语同时进行的上半身手势。它是朝着同时恢复口语与非语言交流的神经假体迈出的重要一步,但距离常规临床应用,仍需要更多研究验证。
1
24
34