透過方向分解斷開 Transformer 表示演化
為何重要
這項研究從數學幾何角度重新審視 Transformer 的內部運作邏輯,繞過了傳統的注意力機制黑箱觀察。它不僅解釋了模型為何能比預期更強健地抵抗幹預,還為未來的模型壓縮與輕量化推理提供了新的理論依據,對於致力於精確控制模型行為的開發者與運維人員具有重要參考價值。
研究者將 Transformer 模型內部的表示演化視為幾何功能,並將學習到的更新分解為平行與垂直元件。研究發現除了預設的殘差恆等路徑外,模型中存在著顯著的平行元件,並透過實驗證實這種幾何分解能解釋模型對抗編輯的強健性以及壓縮帶來的錯誤。
- 研究將 Transformer 的更新分解為平行與垂直元件,並發現在多個預訓練模型中,除了殘差恆等路徑外,平行元件依然佔有相當比重。
- 實驗顯示,排除自我(exclude-self)的值空間平行操作,比殘差空間或垂直操作更能強健地保留自我訊息,且僅增加非自我的聚合訊息。
- 在訓練期間抑制全聚合的平行元件,能顯著降低驗證損失軌跡,並進而提升下游任務的平均表現。