ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ReToken:利用單一 Token 提升視覺語言模型的視覺檢索能力

研究 1 個來源 · 6 天前
為何重要

ReToken 實現了「以 Token 數量換算資源效率」的技術路徑,為解決 GPU 記憶體限制下的長影片或複雜場景 VLM 應用提供了可落地的解決方案,改變了過度依賴擴充模型規模的開發邏輯。這類 plug-and-play 模組能讓開發者在不重訓的情況下,顯著改善現有模型(如 Qwen 母體)的長上下文檢索表現。

視覺語言模型在處理長視覺上下文時,常因幹擾增加導致效能下降,且受制於 GPU 記憶體無法一次性處理所有 Token。研究團隊提出 ReToken,透過單一可學習嵌入從預填充的視覺 KV 快取中選取稀疏且相關的 Token。

  • 在小型資料集上訓練的 ReToken,在 Visual Haystacks 上替 Qwen3VL-8B 提升了 13.4 分(>20% 相對改進),並在 LVBench 上實現長影片零樣本遷移的 8.0 分增益。
  • 框架設計輕量化,訓練與長影片推論機制僅需單個 H100 即可執行。
ReTokenVision-Language ModelsQwen3VLInternVLVisual RetrievalKV Cache

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00