UltraViT:專為大型視覺語言模型的終端裝置效能最佳化視覺編碼器
為何重要
這項研究精準抓到 LVLMs 在終端裝置應用中的軟體架構盲點,將最佳化關鍵從語言模型轉向視覺編碼器,對於實踐格局的 AI 型應用(如手機內建的智慧助理)具體提升可實用性。對開發者而言,提供了兼具延遲最佳化與語義清晰度的新架構解決方案,有助於降低未來模型部署在邊緣端的門檻。
大型視覺語言模型因龐大計算包袱,難以部署在資源受限的終端裝置上,且現有壓縮技術多聚焦於語言模型層級,往往忽略了視覺編碼器的瓶頸。研究團隊提出 UltraViT,這是一個專為終端裝置設計的視覺編碼器,旨在解決現有方案的延遲問題。
- 設計了以真實終端延遲為基礎的金字塔架構,在宏區塊層級系統性地整合與適配異構空間混和器。
- 提出一種兩階段生成式預訓練策略,先利用密集知識蒸餾培育空間特徵,再透過容量混合凍結 LLM 進行生成式監督。
- 比對現有編碼器中心基線,在終端裝置執行速度上超越原有方案近 1.7 倍。