ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

CoVeR:基於覆蓋率的多視角 VLM 3D 推理視覺 Token 剔除技術

研究 1 個來源 · 14 天前
為何重要

此研究直接解決了大型語言模型在處理 3D 視覺資料時的運算成本與資源浪費問題。對於開發者而言,這意味著在不犧牲精確度(效能損失僅 7%)的前提下,能大幅降低推論運算負載,這對於在有限資源裝置(如消費級 GPU)上部署高階 VLM,或即時應用場景(如機器人與自動駕駛)尤為重要。

為了讓 2D 視覺語言模型 (VLM) 能夠執行 3D 推理,研究者通常將場景轉化為多視角影像以重用預訓練先驗,但這會產生使成本隨視角增加而暴漲的成千上萬個冗餘視覺 token。CoVeR 是一種確定性且無需額外訓練的選擇器,僅利用 token 坐標即可確保選出的 token 集合能覆蓋場景的整個區域。

  • 原文分析了現有視覺 token 剔除方法的兩大侷限性:基於重要性的學習方法因冗餘是空間性的,會遺留幾個顯著區域的大量相似 token 而漏掉大部分場景;體素化方法雖改善空間覆蓋,卻無法設定精確預算且容易隨著多視角重疊而飽和。
  • 實驗顯示,CoVeR 改善了這兩方面的問題,僅使用約 8% 的視覺 token,就能保留 93.5% 的全 token 效能,並在所有三個 3D 推理基準測試中超越了先前的最佳技術(SOTA)約 3.9 個百分點。
CoVeRVLMToken Pruning3D ReasoningEfficiency

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00