VisCo:利用大型語言模型作為內在編碼器進行視覺 Token 壓縮
為何重要
VisCo 避免了重新訓練基礎模型,透過「內在壓縮」解決了現有技術效率低與成本高的兩難。對工程師而言,這是加速 VLM 推論的理想最佳化手段;對產業,這類顯著的計算效率提升將成為 VLM 從雲端走向邊緣裝置的重要推手。
為解決視覺-語言模型(VLM)因處理龐大視覺 token 而導致的推論延遲與記憶體負擔,該研究提出 VisCo 框架。VisCo 重用預訓練的 VLM 作為引數共用的自動編碼器,取代昂貴的外部壓縮模組。
- 機制創新:VisCo 是一個訓練高效的自我壓縮框架,透過記憶體 tokens 幫助模型保持層級資訊。
- 效能優勢:實驗顯示其在所有測試的壓縮比率下皆優於先前方法,且在更激進的壓縮下獲益更大。
- 極限測試:該框架在極端單 token 設定下表現穩定,額外學習的 memory tokens 甚至還能提升原基礎模型的能力。