Mage-VL:高效 Codec-native 的流式多模態基礎模型
為何重要
Mage-VL 以 bio-inspired 架構與 codec-native 方法解決了 VLM 在流式任務上的瓶頸,對於需要低遲延、高效率的應用(如機器人、AR/VR)具有重要意義。 - 對開發者而言,大幅降低的 token 消耗與推理加速,直接降低了即時互動系統的算力成本與部署門檻。 - 這項技術證明瞭專用 tokenizers 與稀疏幀取樣策略比傳統全面取樣更高效,可能改變未來多模態模型的競爭焦點。
傳統視覺語言模型受莫拉維奇悖論影響,在流式感知任務上表現不佳且處理效率低。Mage-VL 透過特殊的編碼器架構,針對即時多模態理解進行最佳化。
- 核心元件 Mage-ViT 採用稀疏幀處理與 16x16 補丁設計,將視覺 token 消耗減少超過 75%,同時保留了空間時間上下文。
- 模型在約 5.6 億張影像與 1 億幀影片上訓練,基準效能媲美甚至超過在數十億對資料上訓練的編碼器。
- Mage-VL-4B 靜態任務表現與 Qwen3-VL-4B 相當,但在影片理解與 3D 空間推理上更勝一籌,並達到 3.5 倍的推論速度提升。