SpectralShift:透過譜引數化實現高效 Gated DeltaNet 長上下文擴充套件
為何重要
線性注意力層是長上下文模型的重要方向,但訓練不穩定常是瓶頸。本研究從數學本質切入,提供了一套具體且可行的長上下文持續預訓練最佳化方案,對於追求高效率長上下文模型的研發團隊具有技術指導意義。
- 研究指出線性注意力層目前常遭忽視「狀態動態的譜特性」,直接進行持續預訓練可能受限。
- 決定 GDN 長程資訊檢索能力的關鍵在於:與目標依賴長度對齊的「慢譜帶」以及維持狀態清理的「快速衰減模式」。
- SpectralShift 提出 alpha 投影的重引數化與學習率縮放,以改變衰減譜並提升長上下文訓練效果。
- 實驗證明該方法能在訓練中持續改善長上下文能力,並已將程式碼開源。