Multi-Head Attention Residuals(多頭注意力殘差)
為何重要
MHAR 提供了一種解決隨模型擴充套件而增加的「訓練衝突」的硬體無痛基礎架構解決方案,證明瞭在單一 Transformer 內進行細粒度路由的價值。 對開發者而言,這項技術能以極低引數和計算成本提升訓練漸近線效果;對投資人而言,這顯示了在單純 Scale-out(引數擴張)之外的另一條效能提昇路徑,可能影響未來頂尖 LLM 的訓練策略或效率評估。
標準 Transformer 依賴單一殘差流在深度方向傳遞資訊,而 Attention 殘差雖引入學習型 Softmax,卻因查詢被全寬度共享,導致不同特徵子空隙被迫使用統一分佈讀取歷史成本遞增。
- 研究提出 MHAR,將路由查詢重塑為 H 個獨立頭,實現塊對角線讀取,並透過融合 Triton 核心將訓練吞吐量從基準的 0.2-0.5x 提升至 0.55-0.88x。
- 在經品質過濾並重視 STEM、程式碼的 Nemotron 資料集上大幅提升效果,H=4 或 H=8 為最佳超引數設計點。