3DZip:面向 3D 語言模型的空間感知與特徵多樣性導向 Token 壓縮
為何重要
現有 3D 模型的 token 數量龐大,嚴重限制了其部署與即時性,3DZip 針對傳統方法忽略的「結構化空間性質」提出解法,在計算量銳減下維持幾何一致性與效能,這對於需即時場景理解的應用(如無人載具、機器人)具有重要技術價值。
針對 3D 語言模型(3D VLMs)將 2D 圖特徵投射至世界座標所產生的高額計算與記憶負擔,研究團隊提出了 3DZip 框架,透過三階段機制解決語意選取方法的疏漏。
- 3DZip 包含三個階段:先進行粗粒度體素化以移除點層級冗餘,接著基於特徵空間多樣性選取錨點 token(Determinantal Point Process),最後在空間限制下合併剩餘 token。
- 在三個 3D 問答基準測試中,僅使用 128 個 token 即保留 94.7% 的原有效率,並將推理速度提升 1.92 倍。