ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SAS:透過上下文排序端到端最佳化,簡單的注意力稀疏化

研究 1 個來源 · 9 天前
為何重要

SAS 修正了傳統稀疏注意力方法因「梯度截斷」導致的效能不連貫問題,讓模型能更有效地在限制預算下聚焦於最有價值的上下文。在長上下文語言模型競爭白熱化的當下,這種能提升推理與理解能力的方法,將直接影響下一代生產力應用的競爭力與營運效率。對技術決策者而言,這代表在固定算力預算下最大化模型輸出的具體解法。

Post-training attention sparsification 過去依賴選擇器打分與硬性 Top-K 截斷,這種做法阻斷了語言模型損失函式對選擇器的反向傳播,導致上下文排序與預測影響不一致,浪費預算。為解決此問題,SAS 提出門控稀疏注意力機制,將選擇器連續分數送入 attention logits 以進行端到端最佳化。

  • 將選擇器的連續分數注入 attention logits(而非硬性選取),允許語言模型損失函式透過標準反向傳播更新選擇器,解決梯度割裂問題。
  • Gate 內建於 attention softmax 的日誌形式中,使用 normalized softmax gates 校準歷史上下文與當前 block,並保留連續分數以學習相對優先順序。
  • 實作上具備內建記憶體高效的 Triton kernel,可無縫整合至 FlashAttention-style 運算中,支援長序列訓練。
SASAttention SparsificationTransformersTritonLong Context

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00