編碼早、使用晚:Transformers 何時啟動對推論合作夥伴專長的反應
為何重要
這項研究突破性地揭示 Transformer 架構中隱藏的「資訊可讀性」與「因果有效性」時序錯位,顛覆了早期層僅處理噪音的直觀認知。對於開發者而言,這揭示了模型推理機制的內在邏輯,有助於精確定位進行幹預或從中提取關鍵驅動力的層級;從產業角度,這類基礎解釋性研究是確保生產級 AI Agent 能理解與合作關係並負責任行動的必經之路。
研究發現 Transformer 在變換序列時,往往會在資訊開始影響模型輸出很久之前,就在網路深處編碼下關於對話夥伴專業程度的屬性,這種「可讀取」與「應用」的時序差異對 AI Agent 的發展具關鍵意義。
- 採用 ExpertCollab 語料庫,模擬四個不同專業層級模型角色間的長輪次研究規劃對話。
- 資料顯示,合作物件的專業程度在前半層網路中解讀度最高,但在達到網路中點前已降至近乎隨機水準。
- 透過反事實幹預實驗,證實在某層注入專業差異若對最終輸出改變極小,但在超過中點後注入則會完全傳遞,兩者效果相差一個數量級以上。
- 結論確認推論得出的關係屬性會在成為「因果作用」前很久就被精確表徵,這定義了模型行為的可解釋性邊界。