CADENCE:透過覆蓋適應性在策略知識聲謄,封閉推理差距
為何重要
- Knowledge Distillation(知識聲謄)是縮減模型規模的核心技術,這項研究顯示透過合理設計目標函式,輕量級模型(0.5B)也能在數學推理基準上逼近大型模型。 - 研究否定了「高品質推理必須仰賴資料中心級 GPU」的刻板印象,驗證了輕量運算環境亦可進行具備實際業務價值的模型開發。 - 對於受限於預算或算力供應鏈的公司而言,這類技術路徑提供了在不增加硬體成本的前提下,最佳化現有模型推理效能的新視角。
- CADENCE 是一個統一框架,提出 DRIFT 機制並包含 COVA、FTB、CCD、LAP、EMR、BSD 六個核心元件,旨在解決冷啟動崩潰、狀態忽略及二元獎勵稀疏性等傳統失敗模式。
- 在 GSM8K 問題上,將 0.5B 學生模型從 1.5B 教師模型進行聲謄,達到 69.8% 的 pass@1(預訓練為 48.7%,縮小差距 63.2%);若以 3B 教師模型進行聲謄,則可達 72.1%(縮小差距 76.2%)。
- 所有實驗均在單一的 Apple Mac Studio(M 系列,64GB 統一記憶體)上完成,證明原理性的聲謄在無需資料中心級硬體的情況下也能取得強大的推理品質。