從非侵入式腦磁圖(MEG)解碼感知語音:可解釋的神經源與驅動機制
為何重要
本研究證明透過幾何正規化(如球諧函式)與極淺層解碼器,可以大幅降低高維神經訊號解碼的成本,同時提升模型的可解釋性。對於距離測量和生物訊號分析領域而言,這驗證了在不犧牲感知準確率的情況下,能夠縮減 wav2vec 2.0 等高維目標空間的技術路徑,有助於開發更輕量級的腦機介面或醫療診斷系統。
研究團隊利用模仿 CLIP 風格的深度網架構對應 wav2vec 2.0 音訊嵌入,成功從非侵入式腦磁圖(MEG)記錄中重建受試者感知的短段語音,並透過設計重構前端與解碼器以顯著降低雜訊幹擾。
- 在 MEG-MASC 基準測試中,模型於 1005 個候選物件中達到 39.75% 的 Top-1 準確率,且引數量減少約 20 倍。
- 系統將受試者特定的神經源表示空間從 270 減至 25 節支,並以球諧函式(spherical harmonics)處理三維 MEG 頭盔幾何,使模型權重能對應神經源空間。
- 通過檢測發現,靜音、聲響強度、母音及聲學起音是驅動語音檢索至關重要的 15 個特徵,而強剪維特利亞強度壓縮會明顯導致準確率下降。