SQS:採用稀疏量化子分佈的貝葉斯 DNN 壓縮框架
為何重要
此研究解決了模型壓縮中「壓縮率」與「精準度」的雙重難題,提供了一種結合稀疏化與低位元量化的通用方法,對最佳化邊緣運算裝置上的 LLM 效能有直接助益。儘管目前為研究階段,但該技術與 Llama3.2 和 Qwen2.5 等輕量化模型的潛在結合,顯示出基礎壓縮技術與當前主流 AI 模型開發的強相容性。
- 抵禦資源受限裝置部署大型神經網路的挑戰,現有的單一技術(僅剪枝或僅量化)常導致效能不達預期。
- 提出
SQS框架,結合貝葉斯變分學習,利用 Spike-and-slab 先驗分配誘導稀疏性,並以 Gaussian Mixture Models (GMMs) 模型化量化權重。 - 因目標函式不可解,研究團隊推匯出高效近似解法,並在 ResNet、BERT-base、Llama3.2 與 Qwen2.5 等模型上驗證其壓縮率較基準為高。