統一 Token 壓縮用於高效能 Omni-modal 大語言模型
為何重要
這項技術突破解決了高效能 Omni-LLMs 部署成本過高的痛點,使得在算力受限環境下的執行成為可能。對開發者而言,這是最佳化推理成本的有效工具;對產業而言,能顯著降低多模態雲端服務的基礎設施支出,提升商業模式可行性。
Omni-modal 大語言模型雖然在視覺與聽覺任務上表現優異,但其處理冗長且重複的 audio-visual token 序列會帶來高昂的計算成本。為解決現有壓縮方法在低 token 預算下效能衰退的問題,研究團隊提出 OmniPack 框架,透過協調 LLM 之前的結構壓縮與內部的語義精煉來解決此痛點。
- OmniPack 是一個訓練免費的框架,在 LLM 前利用模態重要性、全域覆蓋率和相似度感知合併去除結構冗餘,並在 LLM 內部透過文字導向和視聽協作鞏固表示。
- 在 Qwen2.5-Omni-7B 的測試中,OmniPack 可以在僅佔用 16.7% 原始 FLOPs 的情況下維持 98.0% 的原有效能;在使用僅 6.8% 原始 FLOPs 時,仍能保持 92.9% 的原有效能。