ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

UltraViT:專為大型視覺語言模型的終端裝置效能最佳化視覺編碼器

研究 1 個來源 · 9 天前
為何重要

這項研究精準抓到 LVLMs 在終端裝置應用中的軟體架構盲點,將最佳化關鍵從語言模型轉向視覺編碼器,對於實踐格局的 AI 型應用(如手機內建的智慧助理)具體提升可實用性。對開發者而言,提供了兼具延遲最佳化與語義清晰度的新架構解決方案,有助於降低未來模型部署在邊緣端的門檻。

大型視覺語言模型因龐大計算包袱,難以部署在資源受限的終端裝置上,且現有壓縮技術多聚焦於語言模型層級,往往忽略了視覺編碼器的瓶頸。研究團隊提出 UltraViT,這是一個專為終端裝置設計的視覺編碼器,旨在解決現有方案的延遲問題。

  • 設計了以真實終端延遲為基礎的金字塔架構,在宏區塊層級系統性地整合與適配異構空間混和器。
  • 提出一種兩階段生成式預訓練策略,先利用密集知識蒸餾培育空間特徵,再透過容量混合凍結 LLM 進行生成式監督。
  • 比對現有編碼器中心基線,在終端裝置執行速度上超越原有方案近 1.7 倍。
UltraViTLVLMVision EncoderEdge AIKnowledge Distillation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00