說話從來不只有文字。人們會點頭、指向某處、聳肩,或藉由動作加重語氣。美國加州大學舊金山分校(UCSF)研究團隊展示了一套腦機介面(BCI),能同時重建這兩條溝通管道。
研究納入 3 名發聲道與肢體嚴重癱瘓者。系統透過單一植入式電極陣列記錄他們嘗試說話及做上半身手勢時的腦部活動,再以機器學習近乎即時地控制個人化虛擬分身,讓分身能同時發聲與動作。
1
7
253 電極如何讀取意圖?
系統採用高密度**皮質腦電圖(ECoG)**電極陣列,共有 253 個電極,放置於感覺運動皮質表面。這片較大範圍的腦皮質,與說話動作及上半身動作都有關聯。
1
7
即使參與者無法如常完成動作,他們仍會嘗試說話和比手勢;植入物記錄與這些意圖相關的神經訊號。接著,機器學習模型把訊號轉成文字及虛擬分身動作,使語音輸出與動作不必分開控制,而能同步出現。
1
4
研究辨識出多種動作的相關訊號,包括與說話有關的嘴部及臉部動作,以及點頭、聳肩、握拳振臂等上半身手勢。研究人員並在其中 2 名參與者身上,以平行的語音與手勢解碼控制虛擬分身。
7
為何要分開訓練語音與手勢解碼器?
語音和手勢都是溝通的一環,但研究團隊沒有把兩者當成單一、籠統的動作指令處理,而是依照預定的語言與動作輸出,採用針對任務設計的解碼方法。
這點很重要:研究指出,同時說話與做手勢時記錄到的神經活動,並不只是「單獨說話訊號」加上「單獨做手勢訊號」的簡單相加。因此,以結合兩種表達的任務訓練後,系統可輸出協調的結果,例如虛擬分身在說出意圖語句的同時,做出相應的上半身手勢。不過,現有報導不足以獨立評估這種非加成效應的規模,也無法完整比較各項任務的解碼表現。
1
4
7
不只把文字打到螢幕上
許多輔助溝通工具仍仰賴使用者逐一選取字母、詞語或圖示。這類系統很有價值,但逐項選擇往往使對話變慢,也相當耗費心力。
UCSF 先前的語音神經義肢研究已凸顯這個落差:一名參與者原有的溝通裝置每分鐘約可輸出 14 個英文單字,實驗系統則能以接近每分鐘 80 個英文單字的速度解碼文字。
28
新系統試圖補上的還有另一個缺口:純文字難以承載對話中的所有社交訊息。手勢可同時傳達同意、強調、問候或指向等意思。因此,會說話也會動的虛擬分身,目標不只是更快顯示文字,而是讓表達方式更接近自然溝通。
1
34
研究對象與可得出的結論
研究人員記錄了3 名發聲道與肢體癱瘓參與者的神經活動,測試內容包括嘗試說話、上半身動作,以及在其中 2 人身上進行的同步語音—手勢解碼。
7
現有資料沒有可靠地逐一說明參與者癱瘓的成因,也未提供完整實驗流程。較廣泛的報導提到,中風和肌萎縮性側索硬化症(ALS)等狀況可能造成相關族群的障礙;但在缺乏完整臨床細節下,不應將任何特定診斷套用到個別參與者身上。
36
仍是研究原型,尚非可購買醫療產品
這套 BCI 目前仍屬研究中的系統。展示版本為有線設計:植入大腦皮質表面的電極網格,必須連接外部的訊號記錄與運算硬體;這會限制日常獨立使用。
研究團隊提出的發展方向是完全植入式的無線版本,以移除穿過皮膚的連接線。不過,提供的資料沒有確立推出時程、製造商或主管機關核准狀態,因此現階段仍不能把它視為已可使用的醫療產品。
與 2023 年語音虛擬分身研究的關係
這項新研究承接 UCSF 在 2023 年主導、發表於《Nature》的研究。當時,一名患有嚴重癱瘓與失語構音症(anarthria)的參與者,透過 253 通道高密度 ECoG 陣列,將意圖句子解碼為文字、合成語音與臉部虛擬分身動畫。
33
早期系統的重點是語音與臉部輸出;新研究則把同類型的表面皮質記錄與 AI 解碼方法,延伸到同步的上半身手勢溝通。這是朝向同時恢復語言與非語言對話能力的神經義肢邁進的一步,但距離常規臨床應用仍需要更多研究。
1
24
34