LensVLM:將長上下文壓縮為圖,並僅解壓縮相關頁面的 9B 視覺語言模型
為何重要
直接挑戰長上下文模型高昂的 Token 成本問題,透過「先壓縮後擷取」的策略顯著降低處理長文件的資源消耗。這種選擇性上下文擴充機制,為開發更高效、低延遲的本地文件分析 Agent 提供了新的技術範式。
LensVLM 是一個 9B 引數的視覺語言模型,旨在將長影片或文件壓縮成視覺影像,並透過學習到的工具僅解壓縮相關頁面。
- 模型大小為 9B 引數,支援 5x、10x 與 15x 的壓縮率。
- 基於 Qwen 模型,並由 Apple AI Research 發表。
- 模型與程式碼依據 Apple ML Research Model License 授權,開源釋出。