使用 2.7-bit S3D8 格式將 11B 多模態模型壓縮至行動 CPU
為何重要
此成果顛覆了「執行低位元 AI 必須依賴專用 NPU 或 GPU 硬體」的刻板印象,證明最佳化的軟體編碼格式與現代 ARM SIMD 指令集足以在處理器核心內完成高效運算。這推動了「模型-硬體協同設計」的趨勢,意味著未來手機效能的競爭點之一,將是如何將模型壓縮至更緊湊的格式並提高編譯 kernels 的效率。
為了應對行動裝置在執行多模態生成式 AI 時的記憶體與頻寬限制,Graphcore Research 與 Arm 聯手開發名為 S3D8 的向量量化格式,將 Llama 3.2 Vision 11B 模型大幅壓縮以在 Pixel 8a 等行動裝置上執行。他們結合此壓縮格式與量化感知訓練(QAT),在大幅降低權重佔用的同時,仍能維持可用的推論效能。
- 將 Llama 3.2 Vision 11B 的 bfloat16 權重(21.3 GB)壓縮至 S3D8 格式後,僅佔 3.7 GB(壓縮率逾 80%),並將引數位元數從 16-bit 降至平均 2.7-bit。
- 於 Pixel 8a 的測試中,S3D8 在記憶體頻寬敏感的 Token 生成任務吞吐量達 33.8 GMAC/s,比 INT8 高出約 28%。
- 透過量化感知訓練與知識蒸餾,壓縮模型在視覺問答基準上的平均分數為 66.1%,大幅優於直接強制轉換的 3.5-bit 模型。