OmniScope:無訓練的多模態分離式 Token 壓縮架構
為何重要
過去多模態壓縮演算法常犯「單向導向」錯誤,導致在壓縮時誤刪答案(Answer-Critical)的關鍵線索。OmniScope 的設計證明瞭將模態顯著性(Salience)分離是平衡推論效率與準確性的有效策略,這對於開發高吞吐量的多模態 Agent 與具備邊緣運算能力的模型部署意義深遠。
面對多模態 LLM 推理速度與記憶體成本高的問題,現有方法常因忽略音訊與視覺對回答關鍵時刻的歧異而失準。OmniScope 提出一個無需訓練的架構,透過分離式估算音訊與視覺的相關性,將查詢作為共享語義錨點,以避免答案關鍵線索被過度修剪。
- 該框架針對四個音訊視覺基準及兩個 Qwen2.5-Omni 模型規模進行驗證。
- 視覺 token 利用 anchor-delta 策略修剪以保留全域性上下文與時間變化,音訊 token 則在每秒內合併以維持時間連續性。
- 在 25% 的整體 token 保留率設定下,達到 3.53x 的 prefill 加速與超過 15% 的 GPU 記憶體減少,平均準確率僅下降 0.35 點。