Graph Machine:透過 Edges 最佳化預訓練架構
為何重要
這項技術突破為長上下文模型的「注意力效率」提供了新答案,有望在維持序列維度(O(n))複雜度的同時,大幅降低訓練與推理的計算負擔。對於致力於模型架構最佳化或關注 Qwen 生態的專業人士來說,這是一個關於如何讓稀疏層更聰高效的關鍵實務參考。
本研究提出 Graph Machine(GM)架構,解決現有稀疏模型中狀態大小受限的瓶頸,並透過 Edge 物件動態路由來維持 O(n) 的狀態複雜度。
- 架構核心:利用模擬指標追逐的可微分推薦機制,在稠密 Transformer 中實現稀疏且動態的 Edge 更新。
- 模型訓練:在 Qwen3-0.6B 上將 75% 的稠密層替換為稀疏層,並於 15.7B tokens 上從頭進行預訓練。
- 引數效率:實驗顯示,在每個 KV head 的 4096 個 tokens 中僅取回 2 個時,模型損失僅對數量級變化;取回 4 個時則有顯著效果提升。