ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LensVLM:將長上下文壓縮為圖,並僅解壓縮相關頁面的 9B 視覺語言模型

研究 1 個來源 · 1 小時前
為何重要

直接挑戰長上下文模型高昂的 Token 成本問題,透過「先壓縮後擷取」的策略顯著降低處理長文件的資源消耗。這種選擇性上下文擴充機制,為開發更高效、低延遲的本地文件分析 Agent 提供了新的技術範式。

LensVLM 是一個 9B 引數的視覺語言模型,旨在將長影片或文件壓縮成視覺影像,並透過學習到的工具僅解壓縮相關頁面。

  • 模型大小為 9B 引數,支援 5x、10x 與 15x 的壓縮率。
  • 基於 Qwen 模型,並由 Apple AI Research 發表。
  • 模型與程式碼依據 Apple ML Research Model License 授權,開源釋出。
appleLensVLMVLMQwen長上下文

來源 · 1 篇報導

首發 Hacker News Front Page huggingface.co 02:36