X-AuT:具備跨尺度知識蒸餾功能之語音 LLM 漸進式音訊編碼器壓縮
為何重要
語音 LLM 的運算成本並非全部來自巨型語言模型 backbone,音訊編碼器佔據顯著算力;X-AuT 提供了將這部分作為壓縮目標的可行解法,有助於開發者實現更低門檻的模型部署。其運用的「行為探針」與「蒸餾」結合技術,也代表基礎模型輕量化正從單純減少層級轉向更細緻的結構最佳化。
為了降低語音大型語言模型的推理成本,研究團隊提出 X-AuT 框架,透過短行為探針選擇最佳層級組合,並結合表示對齊、跨尺度知識蒸餾及 LoRA fine-tuning 來恢復模型精確度。
- 測試於 Qwen3-ASR-0.6B 上,將音訊編碼器從 18 層壓縮至 16 層,錯誤率可從 5.61% 降至 5.27%。
- 壓縮至 14 層時,音訊塔引數減少 20.7%,誤差率為 5.75%。
- 在 1.7B 教師模型的對比中,漸進式修剪(18 層修剪至 14 層)表現優於直接修剪,誤差率分別為 5.75% vs 6.73%。