講嘢從來唔只靠文字。點頭表示認同、聳膊表示無奈、揮手打招呼,全部都係溝通的一部分。美國加州大學三藩市分校(UCSF)研究團隊最新示範一種腦機介面(BCI):單一植入裝置可同時讀取使用者想講的說話,以及想做的上半身手勢,並在接近即時的情況下,控制個人化虛擬化身說話和郁動。
研究涉及 3 名發聲器官及四肢癱瘓人士;他們雖然未能如常完成動作,仍可嘗試說話及做手勢,讓系統從腦部活動中解讀其意圖。
1
7
253 個電極點樣讀取兩種溝通訊號?
研究人員把一組高密度、253 電極的皮層腦電圖(ECoG)陣列放置於大腦表面的感覺運動皮層。這片腦區與說話時口、面部的運動,以及上半身活動都有關。
1
7
當參與者嘗試開口說話、點頭、聳膊或握拳打氣時,植入裝置會記錄相關神經訊號。之後,機器學習模型把訊號轉換成螢幕文字及虛擬化身動作,令語音輸出與身體語言不必分開控制。
1
4
研究顯示,這一組植入裝置可捕捉多類動作的訊號,包括與說話有關的口部及面部活動,及點頭、聳膊、握拳打氣等上半身手勢。當中兩名參與者進一步用平行的說話及手勢解碼,控制化身同步表達。
7
為何要為說話同手勢分開訓練解碼器?
說話和手勢本身密不可分,但研究團隊沒有將它們當成同一種籠統的運動指令處理,而是按語言輸出及動作輸出,採用各自對應的解碼方法。
關鍵在於:參與者一邊嘗試說話、一邊嘗試做手勢時錄得的腦訊號,並不只是「單獨說話訊號」加上「單獨手勢訊號」那麼簡單。因此,以結合兩者的溝通任務訓練系統,有助化身協調地同時輸出說話與動作。現有報道支持這個同步、多模式示範,但未有足夠細節讓外界獨立量化這種非簡單相加的效應,或全面比較各項任務的解碼表現。
1
4
7
比起逐字揀字,化身多咗乜嘢?
不少輔助溝通工具要使用者逐個字、逐個詞或逐個圖示選擇。這些工具很重要,但順序式輸入可以相當慢,亦很費神。
UCSF 早前的說話神經義肢研究已突顯這個差距:一名參與者原有的溝通裝置每分鐘約可輸出 14 個字詞;實驗系統則可把訊號解讀成每分鐘接近 80 個字詞的文字。
28
而新系統處理的不只是速度。文字本身帶不到全部社交意思:同一句話配上點頭、強調動作或打招呼,意思和感覺都可以不同。會講嘢又會郁的化身,目標正是令表達更完整,而不只是將文字顯示在螢幕上。
1
34
參與者做過乜?癱瘓成因又知幾多?
研究人員從 3 名發聲器官及四肢癱瘓參與者錄取腦部活動,測試他們嘗試說話、嘗試做上半身動作,以及其中兩人的同步說話和手勢解碼。
7
提供的資料沒有可靠地逐一交代參與者的癱瘓成因,也沒有完整列出所有實驗程序。相關報道提及,中風及肌萎縮性脊髓側索硬化症(ALS)等狀況可造成這類影響;不過,在沒有完整臨床資料下,不能把任何特定診斷套用到個別參與者身上。
36
距離日常使用仲有幾遠?
這仍是一項研究中的 BCI,而非已可購買或常規臨床使用的醫療產品。現時示範的系統要以導線把腦表面的電極網格連接至外部錄音及運算設備,實際上限制了使用者獨立、全天候使用。
團隊的發展方向是製作完全植入式無線版本,從而移除穿過皮膚的電線。不過,現有資料未有確立推出時間表、製造商或監管審批狀況,因此現階段不宜視為即將面世的產品。
同 UCSF 2023 年成果有咩關係?
今次研究延續 UCSF 團隊在 2023 年發表於《Nature》的工作。當時,一名患嚴重癱瘓及失語症的臨床試驗參與者,透過 253 通道高密度 ECoG 陣列,將預期說出的句子解讀成文字、合成語音及面部虛擬化身動畫。
33
2023 年系統主要集中在說話及面部輸出;今次則沿用「大腦表面記錄加上 AI 解碼」的基本方向,加入同步的上半身手勢溝通。這是朝向同時恢復言語和非言語交流的神經義肢邁進一步,但距離成為普遍臨床工具,仍有大量研究要做。
1
24
34