ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

OmniDelta:OmniLLMs 視聽 Token 壓縮的技能導向預算分配法

研究 1 個來源 · 8 天前
為何重要

OmniDelta 重新定義了多模態模型效率最佳化的邏輯,從單純的「捨棄低品質 tokens」轉向「智慧化的預算分配」,顯著降低了視訊音訊分析的運算門檻。對於企業級平臺與晶片設計廠商而言,這項技術提供了一種在有限硬體資源下提升多模態推理吞吐量的具體解決方案,影響相關應用的部署成本效益。

多模態大型語言模型雖能統一處理文字、音訊與視訊,但長串序列帶來高昂的記憶體與推理成本。現有方法多集中在固定預算下的 token 選擇,且依賴不可靠的跨模態相似度查詰。

  • 提出訓練成本為零的「技能驅動」框架 OmniDelta,結合意圖感知的模態間分配策略,根據查詢需求動態調整音訊與視覺技能池的預算。
  • 該方法利用區域性複雜度與時間冗餘在視訊幀與音訊段之間重新分配模態預算,並相容現有修剪技術以維持總 token 保留率。
  • 在 Qwen2.5-Omni-7B 模型及四個音訊/視訊基準測試中,當僅保留 25% tokens 時,GPU 記憶體需求降低 22.0%,端對端速度提升 1.64 倍。
OmniDeltaOmniLLMs多模態Token 壓縮Qwen2.5-Omni

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00