Apple 發布 LensVLM:利用選擇性上下文擴充套件來提升壓縮視覺文本的精確度
為何重要
這項技術填補了 VLM 在處理高壓縮圖片時的精度缺口,提供了一種高效的處理「圖級」資料的解決方案。對開發者而言,這意味著在不犧牲推理品質的前提下,能顯著減少 Token 的消耗與計算負擔,實現邊緣裝置或低成本推論的可行性。對產業而言,它顯示出 Apple 在多模態技術底座上的深厚研發能力,特別是在 PDF 文件閱讀與圖片識別等具體應用場景中,具有明確的技術壁壘意義。
Apple 提出的 LensVLM 是一個推論框架與後訓練食譜,旨在解決視覺語言模型 (VLM) 在掃描壓縮圖片時,因讀取不清晰導致精確度下降的問題。該方法透過學習到的工具掃描並選擇性擴充套件圖片中可解讀的相關細節,以維持高解析度的理解能力。
- 基於 Qwen3.5-9B-Base 模型建構,能在 4.3 倍有效壓縮比下維持與未壓縮全文本相同的精確度。
- 在七種文本問答基準測試中,當壓縮比達到 10.1 倍時,成效優於基線模型及單純的文本/視覺壓縮方法。
- 技術具備跨領域泛化性,能應用於多模態檔案理解與程式碼分析任務,且隨壓縮比例增加,即時擴充套件的優勢更為顯著。