像物理學家一樣修剪 LLM:Block Removal 作為 Ising Optimization Problem
為何重要
這項技術將統計物理學的「能量-排列」對應關係帶入 LLM 輕量級化領域,解決了傳統僅憑平均值估算而遺漏區塊互動作用的問題。這不僅提供了一種低成本預測模型效能的方式,更啟發業界重視激發態的奇異性。對投資人與開發者而言,這代表最佳化演算法可在算力換取效率的邊際上取得突破,若能結合高效硬體求解器,將是降低 LLM 推理成本與商業化門檻的重要路徑。
為瞭解決 Transformer 模型區塊移除所造成的互動作用組合難題,研究提出將區塊選擇轉化為受限二元最佳化(CBO)問題,這在物理上等同於 Ising 玻璃系統,並可用能量值推斷模型效能。
- 研究使用模型的二階泰勒展開來建立 Hessian 矩陣,捕捉所有區塊之間的非對角線耦合關係,而非單獨評估各區塊重要性。
- 在 Llama-3.3-70B-Instruct 上進行 50% 壓縮時,該方法相比最佳競爭對手在 MMLU 基準測試上提升了約 23 個百分點。
- 解法流程包含暴力法(檢視百億級配置)到經典與量子啟發求解器(如 Tabu search、QAOA),且 Hessian 矩陣只需計算一次即可應用於不同壓縮目標。
- 實驗發現 Llama-3.1-8B-Instruct 通常剪枝尾部區塊,但第 17 個激發態(excited state)移除了模型開頭區塊並經輕度微調,反而超越了最佳單一剪枝配置。